タグ

#Sparse Attentionの記事一覧

2件の記事があります。

推論最適化

Native Sparse Attentionとは?長文LLMを高速化しながら精度も落としにくい学習可能スパース注意

Native Sparse Attentionは、圧縮・選択・局所窓の3経路で長文コンテキストを効率よく扱うスパースattentionです。仕組み、従来法との違い、実験結果、RAGや長文エージェントへの使い道を日本語で整理します。

参照論文:Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention

推論最適化

MInferenceとは?長文LLMのprefillを最大10倍高速化する動的疎Attention技術

MInferenceは、長文LLMのprefillで支配的になるAttention計算を、ヘッドごとの動的疎パターンで削減する推論最適化技術です。3種類の疎パターン、仕組み、実験結果、RAGやエージェント開発への応用ポイントを日本語で解説します。

参照論文:MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention