カテゴリ
LLM・基盤モデルの記事一覧
11件の記事があります。
Mamba-2とは?SSMとAttentionをつなぎ長文LLMを高速化するStructured State Space Duality
Mamba-2は、状態空間モデルとattentionをStructured State Space Dualityで結び、GPUの行列演算を活かして長文系列を効率よく処理するLLMアーキテクチャです。仕組み、評価結果、AI開発への応用を日本語で解説します。
参照論文:Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality
Hyena Hierarchyとは?Attentionなしで長文を高速に扱う長畳み込み言語モデル
Hyena Hierarchyは、attentionの代わりに長い畳み込みと入力依存ゲーティングを組み合わせて長文を扱うモデル構造です。仕組み、実験結果、実装やプロダクトへの応用可能性を日本語で整理します。
参照論文:Hyena Hierarchy: Towards Larger Convolutional Language Models
Infini-attentionとは?長文コンテキストを固定メモリで扱う無限長Transformer
Infini-attentionは、局所attentionに圧縮メモリを組み合わせ、長大な入力を固定メモリで処理する長文向けTransformer技術です。仕組み、評価結果、RAGやエージェントへの使い道を日本語で整理します。
参照論文:Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention
TTT Layersとは?推論中に学習して長文に強くなる新しい系列モデル
TTT Layersは、推論時に隠れ状態そのものを学習器として更新し、長文コンテキストを線形計算量で扱おうとする系列モデルです。仕組み、TransformerやMambaとの違い、実験結果、実務での使い道を日本語で整理します。
参照論文:Learning to (Learn at Test Time): RNNs with Expressive Hidden States
Differential Transformerとは?ノイズを打ち消す差分アテンションで長文理解を強くする技術
Differential Transformerは、2つのsoftmax注意マップの差分で不要な文脈ノイズを打ち消す新しいTransformerです。仕組み、通常のattentionとの違い、実験結果、RAGや長文処理への使い道を日本語で整理します。
参照論文:Differential Transformer
Dual Chunk Attentionとは?追加学習なしでLLMの長文処理を伸ばす長コンテキスト技術
Dual Chunk Attention(DCA)は、追加学習なしでLLMのコンテキスト長を大きく伸ばすための長文処理技術です。RoPEの限界をどう回避するのか、3種類のチャンク注意の仕組み、実験結果、RAGや長文QAへの使い道まで日本語で整理します。
参照論文:Training-Free Long-Context Scaling of Large Language Models
YaRNとは?RoPEでLLMのコンテキスト長を低コストに拡張する技術
YaRNは、RoPEベースの大規模言語モデルのコンテキスト長を少ない追加学習で大きく伸ばす手法です。なぜ長文で崩れるのか、Position Interpolationとの違い、実装上の工夫、実務での使い道まで技術的に解説します。
参照論文:YaRN: Efficient Context Window Extension of Large Language Models
Titansとは?推論時に長期記憶を学習し、長文コンテキストの限界を超えるAIアーキテクチャ
Titansは、注意機構を短期記憶、推論時に更新されるニューラルメモリを長期記憶として組み合わせる新しい系列モデルです。なぜ長文に強いのか、どんな構造で動くのか、RAGやエージェントにどう応用できるのかを技術的に解説します。
参照論文:Titans: Learning to Memorize at Test Time
LongRoPEとは?LLMのコンテキスト長を200万トークン超まで伸ばす仕組みと使い道を解説
LongRoPEは、RoPEの位置補間を次元ごと・位置ごとに最適化し、段階的な拡張と短文脈性能の回復を組み合わせて、既存LLMのコンテキスト長を2048kまで伸ばす技術です。長文RAGやAIエージェントにどう効くのかを日本語で解説します。
参照論文:LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens
Switch Transformerとは?計算量を増やさずにモデル容量を拡張する疎なMoEの仕組みと使い道
Switch Transformerは、トークンごとに1つの専門家だけを選ぶ疎なMixture of Expertsで、計算量を大きく増やさずにモデル容量を拡張する技術です。top-1ルーティング、負荷分散、学習安定化、実務での応用可能性を整理します。
参照論文:Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity
Mambaとは?線形時間で長文を扱える選択的状態空間モデルの仕組みと使い道
Mambaは、Transformerの二乗計算コストを避けながら、入力内容に応じて記憶を選別できる選択的状態空間モデルです。Selective SSM、並列スキャン、長文処理への強さ、実務での応用可能性を日本語で整理します。
参照論文:Mamba: Linear-Time Sequence Modeling with Selective State Spaces