Skip to main content
PromptQuorumBuilt for humans. Structured for AI.

Ollamaで128Kコンテキストに対応するモデルは?

Ollamaで128Kコンテキストに対応するモデルは?

クイック回答

Llama 3.1 8BはOllamaで128Kコンテキストに対応。Qwen3-30B-A3B(Mixture of Expertsモデル)は256Kコンテキストに到達。注意:フルコンテキストの実行はVRAMを大幅に増加させます——128Kウィンドウはデフォルトの4Kウィンドウの3〜4倍のVRAMが必要です。

  • ▸Llama 3.1 8B:128Kコンテキスト、フルコンテキストで~16 GB VRAM
  • ▸Qwen3-30B-A3B:256Kコンテキスト、フルコンテキストで24+ GB VRAM
  • ▸通常使用時はVRAMを節約するため--num-ctx 4096を設定
Ollama

重要なポイント

  • ✓ほとんどの7B Ollamaモデルは128Kコンテキストを宣伝しているが、32Kトークン以上では品質が低下する
  • ✓Llama 3.1 8BとQwen3-30B-A3BはOllamaで128K以上のコンテキストを安定して提供する2つのモデル
  • ✓128Kコンテキストウィンドウはデフォルトと比較してVRAM使用量をほぼ3倍にする可能性がある——7B Q4モデルはデフォルトの約5.5 GBに対し128Kで約15 GBが必要
  • ✓日常的なタスクには<code>--num-ctx 4096</code>を設定し、必要な時だけコンテキストを拡張する

実際に128Kに到達するモデル

ほとんどのOllamaモデルは128Kコンテキストを宣伝していますが、その長さで有用な出力品質を実現するものは少数です。問題は「ロスト・イン・ザ・ミドル」効果:標準的な文書長で訓練されたモデルは、長いコンテキストの深い部分にある情報に注目するのが困難です。

Ollamaで128K以上のコンテキストを安定して提供するモデルは2つ:Llama 3.1 8B(128Kでネイティブ訓練)とQwen3-30B-A3B(Ollama公式ライブラリで256Kコンテキストウィンドウを持つMixture of Expertsモデルで、トークンごとに300億パラメータのうち約30億のみを活性化)。Qwen3の小型の高密度モデルはOllamaでデフォルト40Kコンテキストウィンドウとなり、他の7Bクラスモデルの大部分も32Kトークン以上では出力品質が著しく低下します。

20,000語以上の文書を扱うタスクにはLlama 3.1 8Bから始めてください。最大のコンテキストウィンドウが必要で20+ GB VRAMがある場合は、Qwen3-30B-A3Bが優れた選択肢です。

📍 一文で説明

Ollamaで128K以上のコンテキストを安定して提供する2つのモデルは、Llama 3.1 8B(128K、ネイティブ訓練)とQwen3-30B-A3B(256K、Mixture of Experts)です。

💬 簡潔に説明

Llama 3.1 8Bは最初から128Kトークンのコンテキストを扱えるよう訓練されているため、その長さでも出力品質が安定しています。Qwen3-30B-A3BはMixture of Expertsモデルで、トークンごとに300億パラメータのうち約30億のみを活性化し、Ollamaでは256Kコンテキストウィンドウとして提供されています。他の7Bクラスモデルの大部分は128Kを宣伝していますが、32Kトークンを超えると出力品質が目に見えて低下します。

長いコンテキストのVRAMコスト

コンテキストウィンドウを拡張するとVRAM使用量が大幅に増加します。KV-Cache(コンテキスト内のすべてのトークンのアテンション状態を保存)は、128Kコンテキストではモデルの重みと同量のVRAMを使用することがあります。

下の表はQ4_K_Mの7BモデルにおけるKV-CacheのVRAMスケーリングを示します。これらの数値はGrouped Query Attention(GQA)を使用するモデルを想定しています——GQAを使用しないモデルはKV-Cacheの使用量が大幅に多くなります。

日常的なタスクでVRAMを節約するには、Ollamaの起動時に--num-ctx 4096を設定してください。特定のタスクで必要な場合にのみ32Kや128Kに拡張します。モデル選択やRAM分割を含む長文コンテキストLLMの完全ガイドは、長文コンテキストローカルLLMガイドをご覧ください。

コンテキスト長KV-Cache (7B)合計VRAM (7B Q4)
4K(デフォルト)~0.5 GB~5.5 GB
16K~1.5 GB~6.5 GB
32K~3 GB~8 GB
128K~10 GB~15 GB

関連ガイド

長文コンテキストモデルに関するよくある質問

Ollamaで128Kコンテキストを有効にするには?▾
実行コマンドに--num-ctx 131072を追加します:ollama run llama3.1:8b --num-ctx 131072。このフラグがない場合、OllamaのModelfile仕様ではnum_ctxのデフォルトは2048ですが、VRAM階層別のランタイムデフォルト(24 GiB未満は4K、24〜48 GiBは32K、それ以上は256K)でもモデルの最大能力に届かないことがあります。確実に使うにはnum_ctxを明示的に設定してください。
長いコンテキストはなぜVRAMを大量に消費するのですか?▾
KV-Cacheはコンテキスト内のすべてのトークンのアテンション状態を保存します。128Kトークンでは、このキャッシュはモデルの重みと同じ大きさになることがあります。7B Q4モデルは重みに約5.5 GBが必要ですが、128Kコンテキストでは約10 GBのKV-Cacheが必要です。
128Kコンテキストはコーディングに役立ちますか?▾
はい、大規模なコードベースを扱う際に有効です。リポジトリ全体や複数ファイルをコンテキストに収めることで、リファクタリングやファイル横断的な推論タスクが大幅に改善されます。128K以上での大規模コードベースのコーディングには、Qwen3-30B-A3Bが推奨モデルです。
長文ドキュメント分析に最適なモデルは?▾
Qwen3-30B-A3BはOllamaでの長文ドキュメントにおける第一選択肢です——256Kコンテキストウィンドウは128Kクラスのモデルよりも余裕があり、Mixture of Expertsモデルとして同規模の高密度モデルより高速に動作します。長文ドキュメントと並行して画像理解も必要な場合は、Ollamaビジョンモデルをご覧ください。