OllamaでVisionに対応しているモデルは?

クイック回答
2026年時点でOllamaの最良のVisionモデルはQwen3-VLとGemma 4で、どちらもネイティブにマルチモーダルです。LLaVAは広い互換性を持つ最も安全な代替として残っています。Llama 3.2 Visionは現在Ollamaで動作しません(「unknown model architecture: mllama」)——代わりにQwen3-VLかGemma 4を使ってください。
- ▸qwen3-vl:最も強力なVisionファミリー、OCR・チャート・スクリーンショットに最適
- ▸gemma4:全サイズにVisionを内蔵、ツールコールにも対応
- ▸llava:最も安全な代替、クライアント互換性が最も広い
- ▸llama3.2-vision:Ollama v0.30.0以降で動作不可(「unknown model architecture: mllama」)
重要なポイント
- ✓2026年9月時点で、OllamaをリードするVisionモデルはQwen3-VLとGemma 4です——どちらも以前のQwen2.5-VL・Gemma 3世代を置き換えました
- ✓Llama 3.2 VisionはOllama v0.30.0以降で現在動作しません:「Error: unknown model architecture: mllama」というエラーが発生します。これはOllamaのllama.cppベースのエンジンがmllamaに対応していないためです
- ✓LLaVA 7Bは最も安全な代替です(~7 GB VRAM、すべてのOllamaバージョンで動作)
- ✓OCR・チャート・スクリーンショットにはQwen3-VLを、Vision機能とツールコールを1つのモデルで使いたい場合はGemma 4を使用してください
OllamaのトップVisionモデル
2026年にOllamaのVisionラインナップは大きく変わりました:Qwen3-VLとGemma 4が最も強力な選択肢となり、Llama 3.2 Visionは現行のOllamaバージョンでは読み込めなくなっています。残る各モデルには異なる強みとVRAMプロファイルがあります。
Qwen3-VLはOllamaで利用できる中で最も強力なオープンVision言語モデルファミリーです——OCR、チャート、図、スクリーンショット・UI理解で優れており、2Bのエッジモデルから235Bのmixture-of-expertsバリアントまで揃っています。Gemma 4はネイティブのVisionを全サイズ(2B〜31B)に組み込み、ツールコールにも対応しているため、画像理解とツール呼び出しを1つのモデルで両立させたい場合に最適です。LLaVAは広いクライアント互換性を持つ最も安全な出発点であり続けます。前世代のQwen2.5-VLは引き続き動作し、すでにダウンロード済みであれば有効な軽量選択肢です。
すべてのVisionモデルはLLMの重みと並行して画像エンコーダーを読み込みます。このエンコーダーはベースのテキストモデルが必要とするVRAMに加えて1–3 GB追加されます——VRAMの予算を確認する際はこのオーバーヘッドを計画に含めてください。
Error: unknown model architecture: "mllama"で失敗するようになりました——mllamaアーキテクチャはllama.cppに一度も追加されていません。この問題はOllama v0.33.2(2026年8月)時点でも未解決です。代わりにQwen3-VLまたはGemma 4を使用するか、Llama 3.2 Visionがどうしても必要な場合はv0.30.0より前のOllamaを維持してください。VisionのVRAM要件
すべてのVisionモデルは、テキストのみの同等モデルよりも多くのVRAMを必要とします。7〜8BのVisionモデルは通常7–9 GB VRAMが必要で、同程度のサイズのテキストのみのモデルで想定する~6 GBではありません。
OCR、チャート、ドキュメント分析には、Qwen3-VL 8BがVRAM効率の面で最も優れた強力な選択肢です。Vision機能とツールコールを1つのモデルで使いたい場合、Gemma 4の12Bまたは26B-A4B MoEバリアントは8〜14 GBに収まります。マルチモーダルローカルモデルのユースケース別ガイドは、マルチモーダルローカルLLMガイドをご覧ください。
| モデル | Q4でのVRAM | 画像機能 |
|---|---|---|
| LLaVA 7B | ~7 GB | 一般的な画像Q&A、広い互換性 |
| Qwen3-VL 8B | ~8 GB | OCR、チャート、スクリーンショット、多言語 |
| Gemma 4(12B) | ~8 GB | Vision + ツールコール |
| Gemma 4(26B-A4B MoE) | ~14 GB | Vision + ツールコール、高品質 |
| Llama 3.2 Vision 11B | ~10 GB | ⚠️ Ollama v0.30.0以降で動作不可(mllamaエラー) |
関連ガイド
- ▸OllamaでQwen 3を実行する -- ツールコール対応のマルチモーダルオプション
- ▸Ollama 128Kコンテキストモデル -- long context models
- ▸マルチモーダルローカルLLMガイド -- ローカルVisionモデルの完全ガイド
- ▸2026年ベストローカルVisionモデル -- あらゆるVisionモデル、あらゆるGPU
Ollama Visionモデルへのよくある質問
API経由でOllamaに画像を送るにはどうすればいいですか?▾
/api/chatエンドポイントにPOSTリクエストを送り、images配列にbase64文字列として画像を含めます。最小動作JSONボディ: {"model":"llava","messages":[{"role":"user","content":"What is in this image?","images":["<base64>"]}]} ツールコールサポートが強いマルチモーダル対応オプションはOllamaでのQwen 3をご覧ください。