Q4_K_M vs Q8_0:どちらを選ぶべきですか?

クイック回答
VRAMが8 GB以下ならQ4_K_Mを使用してください。12 GB以上あるならQ8_0を使用してください。Q4_K_Mはおよそ半分のファイルサイズでQ8_0の95%の品質を提供します。
- ▸Q4_K_M:7Bモデルで~5–6 GB、8 GB VRAMに最適
- ▸Q8_0:7Bモデルで~8–9 GB、12+ GB VRAM必要
- ▸実際の使用では品質差は5%未満
重要なポイント
- ✓8 GB VRAM以下:Q4_K_Mを使用 — ほぼ半分のファイルサイズでQ8_0の95%の品質を提供
- ✓12+ GB VRAM:Q8_0はスピードペナルティなしでほぼ完全精度の品質に値します
- ✓Ollamaを毎日使用するほとんどのユーザーにとって、Q4_K_Mが正しい選択です
簡潔な結論
Q8_0は完全精度品質の約99%を維持します。Q4_K_Mは約92%です。この7ポイントの差はチャット、コーディング、要約では見えません — ローカルLLM使用の95%をカバーする3つのタスクです。Q8_0が優位に立つのは、長文の事実想起、複数ステップの数学、500行以上の正確な構文が必要なコードのみです。
Q4_K_Mが正しいデフォルトである理由は、Q8_0の追加品質が現れるのがエッジケースのみだからです:正確な事実想起を必要とする長文生成、または高精度を必要とする数学的推論。他のすべてに対して、Q4_K_Mは実際にはQ8_0と同等です。
すでにQ4_K_Mを使用していて結果がおかしく感じる場合、問題はほとんどの場合量化ではありません — モデルのサイズやプロンプト構造にあります。
並列比較
以下の表は7BモデルのQ4_K_MとQ8_0を比較しています。両フォーマットは特別な設定なしにOllama、LM Studio、llama.cppで動作します。
Q4_K_Mとk-quant圧縮について理解するには、Q4_K_M解説ガイドを参照してください。完全な量化リファレンスは量化レベル比較を参照してください。
Q4_K_Mの品質ギャップを明らかにする3つのタスク:長文書の想起(50ページ以上)、中間状態を伴う複数ステップの数学、300行以上のコード生成です。これらにおいて、Q8_0の追加精度は長い出力で積み重なる小さなドリフトエラーを防ぎます。他のすべて — チャット、200行未満のコード、Q&A、要約 — ではギャップは見えません。決定前の復習はQ4_K_Mの意味を参照してください。
| 指標 | Q4_K_M | Q8_0 |
|---|---|---|
| ファイルサイズ(7Bモデル) | ~4.1 GB | ~7.7 GB |
| VRAM必要量(7B) | 5–6 GB | 8–9 GB |
| 完全精度に対する品質 | ~92% | ~99% |
| 最適な対象 | 6–8 GB VRAM | 12+ GB VRAM |
Q4_K_M vs Q8_0に関するよくある質問
Q8_0はQ4_K_Mより明らかに優れていますか?▾
Q8_0はQ4_K_Mより速いですか?▾
異なるタスクでQ4_K_MとQ8_0を切り替えられますか?▾
ollama pull llama3:8b-q4_K_Mとollama pull llama3:8b-q8_0は別々のダウンロードです。ollama runでタグを指定して切り替えます。