ما نماذج Ollama التي تدعم الرؤية؟

إجابة سريعة
أفضل نماذج الرؤية في Ollama لعام 2026 هي Qwen3-VL و Gemma 4، وكلاهما متعدد الوسائط أصليًا. يبقى LLaVA الخيار الأكثر أمانًا لتوافقه الواسع. Llama 3.2 Vision معطّل حاليًا في Ollama ("unknown model architecture: mllama") — استخدم Qwen3-VL أو Gemma 4 بدلًا منه.
- ▸qwen3-vl: أقوى عائلة رؤية، الأفضل لـ OCR والرسوم البيانية ولقطات الشاشة
- ▸gemma4: الرؤية مدمجة في كل الأحجام، إضافة إلى استدعاء الأدوات
- ▸llava: الخيار الأكثر أمانًا، أوسع توافق مع العملاء
- ▸llama3.2-vision: معطّل في Ollama v0.30.0 وما بعده ("unknown model architecture: mllama")
النقاط الرئيسية
- ✓اعتبارًا من سبتمبر 2026، نماذج الرؤية الرائدة في Ollama هي Qwen3-VL و Gemma 4 — وكلاهما حلّ محل الجيل السابق Qwen2.5-VL / Gemma 3
- ✓Llama 3.2 Vision معطّل حاليًا على Ollama الإصدار v0.30.0 وما بعده: يفشل بخطأ "Error: unknown model architecture: mllama" لأن محرك Ollama الجديد المبني على llama.cpp لا يدعم mllama
- ✓يبقى LLaVA 7B الخيار الأكثر أمانًا (~7 GB VRAM، يعمل على أي إصدار من Ollama)
- ✓استخدم Qwen3-VL لـ OCR والرسوم البيانية ولقطات الشاشة؛ استخدم Gemma 4 عند الحاجة إلى الرؤية واستدعاء الأدوات في نموذج واحد
أبرز نماذج الرؤية في Ollama
تغيّرت مجموعة نماذج الرؤية في Ollama بشكل كبير خلال 2026: أصبح Qwen3-VL و Gemma 4 الآن الخيارين الأقوى، ولم يعد Llama 3.2 Vision يعمل على إصدارات Ollama الحالية. لكل نموذج متبقٍ قوة مميزة وملف VRAM خاص.
يُعد Qwen3-VL أقوى عائلة نماذج رؤية-لغة مفتوحة متاحة على Ollama — يتصدر في OCR والرسوم البيانية والمخططات وفهم لقطات الشاشة وواجهات المستخدم، ويمتد من نموذج 2B للأجهزة الطرفية إلى نسخة 235B بتقنية mixture-of-experts. يضيف Gemma 4 رؤية أصلية إلى كل الأحجام (2B–31B) إلى جانب استدعاء الأدوات، مما يجعله الخيار الأفضل عندما يحتاج نموذج واحد إلى رؤية الصور واستدعاء الأدوات معًا. يبقى LLaVA نقطة البداية الأكثر أمانًا لتوافقه الواسع مع العملاء. لا يزال Qwen2.5-VL، جيل Qwen السابق، يعمل ويظل خيارًا خفيفًا صالحًا إذا كان محملًا لديك بالفعل.
تحمّل جميع نماذج الرؤية مشفّر صور إلى جانب أوزان نموذج اللغة. يضيف هذا المشفّر 1–3 GB VRAM فوق ما يحتاجه النموذج الأساسي النصي فقط — ضع هذا الحمل الإضافي في حسبانك عند مراجعة ميزانية VRAM.
Error: unknown model architecture: "mllama" — لم تُضَف بنية mllama إلى llama.cpp قط. لا يزال هذا دون حل حتى إصدار Ollama v0.33.2 (أغسطس 2026). استخدم Qwen3-VL أو Gemma 4 بدلًا منه، أو احتفظ بتثبيت Ollama سابق لإصدار v0.30.0 إذا كنت بحاجة تحديدًا إلى Llama 3.2 Vision.متطلبات VRAM للرؤية
كل نموذج رؤية يحتاج VRAM أكثر من نظيره النصي. يتطلب نموذج رؤية بحجم 7–8B عادةً 7–9 GB VRAM، وليس ~6 GB التي ستُخصصها لنموذج نصي بحجم مشابه.
لـ OCR والرسوم البيانية وتحليل المستندات، يُعد Qwen3-VL 8B الخيار القوي الأكثر كفاءة في VRAM. للرؤية واستدعاء الأدوات في نموذج واحد، تتسع نسختا Gemma 4 بحجم 12B أو 26B-A4B MoE ضمن 8–14 GB. للدليل الكامل حول نماذج اللغة المحلية متعددة الوسائط ومطابقة حالات الاستخدام، راجع دليل نماذج اللغة المحلية متعددة الوسائط.
| الطراز | VRAM بتحديد Q4 | قدرة معالجة الصور |
|---|---|---|
| LLaVA 7B | ~7 GB | أسئلة وأجوبة عامة على الصور، توافق واسع |
| Qwen3-VL 8B | ~8 GB | OCR، رسوم بيانية، لقطات شاشة، متعدد اللغات |
| Gemma 4 (12B) | ~8 GB | رؤية + استدعاء أدوات |
| Gemma 4 (26B-A4B MoE) | ~14 GB | رؤية + استدعاء أدوات، جودة أعلى |
| Llama 3.2 Vision 11B | ~10 GB | ⚠️ معطّل في Ollama v0.30.0+ (خطأ mllama) |
أدلة ذات صلة
- ▸تشغيل Qwen 3 على Ollama -- خيار متعدد الوسائط مع استدعاء الأدوات
- ▸نماذج Ollama ذات سياق 128K -- long context models
- ▸دليل نماذج اللغة المحلية متعددة الوسائط -- دليل كامل لنماذج الرؤية المحلية
- ▸أفضل نماذج الرؤية المحلية 2026 -- كل نموذج رؤية، كل فئة GPU
إجابات سريعة حول نماذج رؤية Ollama
كيف أرسل صورة إلى Ollama عبر الواجهة البرمجية؟▾
/api/chat مع الصورة كسلسلة base64 في مصفوفة images. نص JSON الأدنى المطلوب: {"model":"llava","messages":[{"role":"user","content":"What is in this image?","images":["<base64>"]}]} راجع Qwen 3 على Ollama لخيار متعدد الوسائط مع دعم قوي لاستدعاء الأدوات.