タグ

#Long Contextの記事一覧

11件の記事があります。

LLM・基盤モデル

Mamba-2とは?SSMとAttentionをつなぎ長文LLMを高速化するStructured State Space Duality

Mamba-2は、状態空間モデルとattentionをStructured State Space Dualityで結び、GPUの行列演算を活かして長文系列を効率よく処理するLLMアーキテクチャです。仕組み、評価結果、AI開発への応用を日本語で解説します。

参照論文:Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality

推論最適化

Ring Attentionとは?複数GPUで長文コンテキストを線形に伸ばす分散Attention技術

Ring Attentionは、長い系列を複数デバイスに分散し、KVブロック通信とblockwise attention計算を重ねることで、近似なしに長文コンテキストを扱う技術です。仕組み、評価結果、AI開発への応用を日本語で解説します。

参照論文:Ring Attention with Blockwise Transformers for Near-Infinite Context

LLM・基盤モデル

Infini-attentionとは?長文コンテキストを固定メモリで扱う無限長Transformer

Infini-attentionは、局所attentionに圧縮メモリを組み合わせ、長大な入力を固定メモリで処理する長文向けTransformer技術です。仕組み、評価結果、RAGやエージェントへの使い道を日本語で整理します。

参照論文:Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention

LLM・基盤モデル

TTT Layersとは?推論中に学習して長文に強くなる新しい系列モデル

TTT Layersは、推論時に隠れ状態そのものを学習器として更新し、長文コンテキストを線形計算量で扱おうとする系列モデルです。仕組み、TransformerやMambaとの違い、実験結果、実務での使い道を日本語で整理します。

参照論文:Learning to (Learn at Test Time): RNNs with Expressive Hidden States

推論最適化

LoongServeとは?長文LLMの推論を高速化するElastic Sequence Parallelismの仕組みと使い道

LoongServeは、長文LLMのprefillとdecodeで必要なGPU並列度を動的に切り替える推論サービング技術です。Elastic Sequence Parallelismの考え方、仕組み、評価結果、RAGやAIエージェントへの応用可能性を日本語で整理します。

参照論文:LoongServe: Efficiently Serving Long-Context Large Language Models with Elastic Sequence Parallelism

推論最適化

Native Sparse Attentionとは?長文LLMを高速化しながら精度も落としにくい学習可能スパース注意

Native Sparse Attentionは、圧縮・選択・局所窓の3経路で長文コンテキストを効率よく扱うスパースattentionです。仕組み、従来法との違い、実験結果、RAGや長文エージェントへの使い道を日本語で整理します。

参照論文:Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention

LLM・基盤モデル

Differential Transformerとは?ノイズを打ち消す差分アテンションで長文理解を強くする技術

Differential Transformerは、2つのsoftmax注意マップの差分で不要な文脈ノイズを打ち消す新しいTransformerです。仕組み、通常のattentionとの違い、実験結果、RAGや長文処理への使い道を日本語で整理します。

参照論文:Differential Transformer

推論最適化

RAPIDとは?長文LLM推論をRAGとSpeculative Decodingで高速化する技術

RAPIDは、長文コンテキストLLMの推論をRAGベースのドラフト生成と推論時知識転移で高速化しつつ、応答品質まで引き上げる手法です。長文推論がなぜ遅いのか、どこでRAGが効くのか、実装の勘所まで技術的に解説します。

参照論文:RAPID: Long-Context Inference with Retrieval-Augmented Speculative Decoding

LLM・基盤モデル

YaRNとは?RoPEでLLMのコンテキスト長を低コストに拡張する技術

YaRNは、RoPEベースの大規模言語モデルのコンテキスト長を少ない追加学習で大きく伸ばす手法です。なぜ長文で崩れるのか、Position Interpolationとの違い、実装上の工夫、実務での使い道まで技術的に解説します。

参照論文:YaRN: Efficient Context Window Extension of Large Language Models

推論最適化

MInferenceとは?長文LLMのprefillを最大10倍高速化する動的疎Attention技術

MInferenceは、長文LLMのprefillで支配的になるAttention計算を、ヘッドごとの動的疎パターンで削減する推論最適化技術です。3種類の疎パターン、仕組み、実験結果、RAGやエージェント開発への応用ポイントを日本語で解説します。

参照論文:MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention

推論最適化

LongLLMLinguaとは?長文プロンプトを圧縮してLLMの精度・速度・コストを同時に改善する技術

LongLLMLinguaは、質問に関係する情報を残しながら長文プロンプトを段階的に圧縮し、LLMの長文処理を安く速くしつつ精度低下も抑える技術です。RAGや長文QA、要約で効く仕組みと実務での使い道を解説します。

参照論文:LongLLMLingua: Accelerating and Enhancing LLMs in Long Context Scenarios via Prompt Compression