Skip to main content
PromptQuorum

OllamaでVisionに対応しているモデルは?

OllamaでVisionに対応しているモデルは?

クイック回答

2026年時点でOllamaの最良のVisionモデルはQwen3-VLとGemma 4で、どちらもネイティブにマルチモーダルです。LLaVAは広い互換性を持つ最も安全な代替として残っています。Llama 3.2 Visionは現在Ollamaで動作しません(「unknown model architecture: mllama」)——代わりにQwen3-VLかGemma 4を使ってください。

  • qwen3-vl:最も強力なVisionファミリー、OCR・チャート・スクリーンショットに最適
  • gemma4:全サイズにVisionを内蔵、ツールコールにも対応
  • llava:最も安全な代替、クライアント互換性が最も広い
  • llama3.2-vision:Ollama v0.30.0以降で動作不可(「unknown model architecture: mllama」)
Ollama

重要なポイント

  • 2026年9月時点で、OllamaをリードするVisionモデルはQwen3-VLとGemma 4です——どちらも以前のQwen2.5-VL・Gemma 3世代を置き換えました
  • Llama 3.2 VisionはOllama v0.30.0以降で現在動作しません:「Error: unknown model architecture: mllama」というエラーが発生します。これはOllamaのllama.cppベースのエンジンがmllamaに対応していないためです
  • LLaVA 7Bは最も安全な代替です(~7 GB VRAM、すべてのOllamaバージョンで動作)
  • OCR・チャート・スクリーンショットにはQwen3-VLを、Vision機能とツールコールを1つのモデルで使いたい場合はGemma 4を使用してください

OllamaのトップVisionモデル

2026年にOllamaのVisionラインナップは大きく変わりました:Qwen3-VLとGemma 4が最も強力な選択肢となり、Llama 3.2 Visionは現行のOllamaバージョンでは読み込めなくなっています。残る各モデルには異なる強みとVRAMプロファイルがあります。

Qwen3-VLはOllamaで利用できる中で最も強力なオープンVision言語モデルファミリーです——OCR、チャート、図、スクリーンショット・UI理解で優れており、2Bのエッジモデルから235Bのmixture-of-expertsバリアントまで揃っています。Gemma 4はネイティブのVisionを全サイズ(2B〜31B)に組み込み、ツールコールにも対応しているため、画像理解とツール呼び出しを1つのモデルで両立させたい場合に最適です。LLaVAは広いクライアント互換性を持つ最も安全な出発点であり続けます。前世代のQwen2.5-VLは引き続き動作し、すでにダウンロード済みであれば有効な軽量選択肢です。

すべてのVisionモデルはLLMの重みと並行して画像エンコーダーを読み込みます。このエンコーダーはベースのテキストモデルが必要とするVRAMに加えて1–3 GB追加されます——VRAMの予算を確認する際はこのオーバーヘッドを計画に含めてください。

Llama 3.2 Visionは現在Ollamaで動作しません。Ollama v0.30.0(2026年5月)がモデル読み込みをllama.cppベースに移行して以来、llama3.2-visionはError: unknown model architecture: "mllama"で失敗するようになりました——mllamaアーキテクチャはllama.cppに一度も追加されていません。この問題はOllama v0.33.2(2026年8月)時点でも未解決です。代わりにQwen3-VLまたはGemma 4を使用するか、Llama 3.2 Visionがどうしても必要な場合はv0.30.0より前のOllamaを維持してください。

VisionのVRAM要件

すべてのVisionモデルは、テキストのみの同等モデルよりも多くのVRAMを必要とします。7〜8BのVisionモデルは通常7–9 GB VRAMが必要で、同程度のサイズのテキストのみのモデルで想定する~6 GBではありません。

OCR、チャート、ドキュメント分析には、Qwen3-VL 8BがVRAM効率の面で最も優れた強力な選択肢です。Vision機能とツールコールを1つのモデルで使いたい場合、Gemma 4の12Bまたは26B-A4B MoEバリアントは8〜14 GBに収まります。マルチモーダルローカルモデルのユースケース別ガイドは、マルチモーダルローカルLLMガイドをご覧ください。

モデルQ4でのVRAM画像機能
LLaVA 7B~7 GB一般的な画像Q&A、広い互換性
Qwen3-VL 8B~8 GBOCR、チャート、スクリーンショット、多言語
Gemma 4(12B)~8 GBVision + ツールコール
Gemma 4(26B-A4B MoE)~14 GBVision + ツールコール、高品質
Llama 3.2 Vision 11B~10 GB⚠️ Ollama v0.30.0以降で動作不可(mllamaエラー)

関連ガイド

Ollama Visionモデルへのよくある質問

API経由でOllamaに画像を送るにはどうすればいいですか?
/api/chatエンドポイントにPOSTリクエストを送り、images配列にbase64文字列として画像を含めます。最小動作JSONボディ: {"model":"llava","messages":[{"role":"user","content":"What is in this image?","images":["<base64>"]}]} ツールコールサポートが強いマルチモーダル対応オプションはOllamaでのQwen 3をご覧ください。
なぜllama3.2-visionは「unknown model architecture: mllama」で失敗するのですか?
Ollama v0.30.0(2026年5月)はモデル読み込みをllama.cppベースに移行しましたが、Llama 3.2 Visionが使用するmllamaアーキテクチャへの対応が一度も追加されませんでした。そのためllama3.2-visionはOllama v0.30.0以降のすべてのバージョン(v0.33.2を含む)で動作しません。公式な修正はまだありません:代わりにQwen3-VLまたはGemma 4を使用するか、この目的のためだけにv0.30.0より前のOllamaを維持してください。
VisionモデルはOCR(画像からテキストを読み取る)できますか?
はい、ただし品質は異なります。現在、動作するOllama Visionモデルの中でQwen3-VLが最も優れたOCR性能を持ちます——以前はLlama 3.2 Visionが最有力でしたが、Ollama v0.30.0以降では動作しません。LLaVA 7Bは明瞭に印刷されたテキストは読めますが、手書きや小さいフォントは苦手です。
チャートや図に最適なOllama Visionモデルはどれですか?
Qwen3-VLです。チャート、表、図、スクリーンショット理解で優れており、ドキュメント理解ベンチマークでLLaVAや前世代のQwen2.5-VLを上回ります。
Visionモデルは1つのプロンプトで複数の画像をサポートしていますか?
モデルとOllamaのバージョンによって対応状況が異なります。LLaVAとQwen2.5-VLは現在Ollamaで1ターンに1枚の画像を処理します。Qwen3-VLとGemma 4はより長いコンテキスト設定でマルチ画像入力に対応しています——最新の上限は各モデルのOllamaライブラリページで確認してください。