Skip to main content
PromptQuorum

ما نماذج ⁨Ollama⁩ التي تدعم الرؤية؟

ما نماذج ⁨Ollama⁩ التي تدعم الرؤية؟

إجابة سريعة

أفضل نماذج الرؤية في Ollama لعام 2026 هي Qwen3-VL و Gemma 4، وكلاهما متعدد الوسائط أصليًا. يبقى LLaVA الخيار الأكثر أمانًا لتوافقه الواسع. Llama 3.2 Vision معطّل حاليًا في Ollama ("unknown model architecture: mllama") — استخدم Qwen3-VL أو Gemma 4 بدلًا منه.

  • qwen3-vl: أقوى عائلة رؤية، الأفضل لـ OCR والرسوم البيانية ولقطات الشاشة
  • gemma4: الرؤية مدمجة في كل الأحجام، إضافة إلى استدعاء الأدوات
  • llava: الخيار الأكثر أمانًا، أوسع توافق مع العملاء
  • llama3.2-vision: معطّل في Ollama v0.30.0 وما بعده ("unknown model architecture: mllama")
Ollama

النقاط الرئيسية

  • اعتبارًا من سبتمبر 2026، نماذج الرؤية الرائدة في Ollama هي Qwen3-VL و Gemma 4 — وكلاهما حلّ محل الجيل السابق Qwen2.5-VL / Gemma 3
  • Llama 3.2 Vision معطّل حاليًا على Ollama الإصدار v0.30.0 وما بعده: يفشل بخطأ "Error: unknown model architecture: mllama" لأن محرك Ollama الجديد المبني على llama.cpp لا يدعم mllama
  • يبقى LLaVA 7B الخيار الأكثر أمانًا (~7 GB VRAM، يعمل على أي إصدار من Ollama)
  • استخدم Qwen3-VL لـ OCR والرسوم البيانية ولقطات الشاشة؛ استخدم Gemma 4 عند الحاجة إلى الرؤية واستدعاء الأدوات في نموذج واحد

أبرز نماذج الرؤية في Ollama

تغيّرت مجموعة نماذج الرؤية في Ollama بشكل كبير خلال 2026: أصبح Qwen3-VL و Gemma 4 الآن الخيارين الأقوى، ولم يعد Llama 3.2 Vision يعمل على إصدارات Ollama الحالية. لكل نموذج متبقٍ قوة مميزة وملف VRAM خاص.

يُعد Qwen3-VL أقوى عائلة نماذج رؤية-لغة مفتوحة متاحة على Ollama — يتصدر في OCR والرسوم البيانية والمخططات وفهم لقطات الشاشة وواجهات المستخدم، ويمتد من نموذج 2B للأجهزة الطرفية إلى نسخة 235B بتقنية mixture-of-experts. يضيف Gemma 4 رؤية أصلية إلى كل الأحجام (2B–31B) إلى جانب استدعاء الأدوات، مما يجعله الخيار الأفضل عندما يحتاج نموذج واحد إلى رؤية الصور واستدعاء الأدوات معًا. يبقى LLaVA نقطة البداية الأكثر أمانًا لتوافقه الواسع مع العملاء. لا يزال Qwen2.5-VL، جيل Qwen السابق، يعمل ويظل خيارًا خفيفًا صالحًا إذا كان محملًا لديك بالفعل.

تحمّل جميع نماذج الرؤية مشفّر صور إلى جانب أوزان نموذج اللغة. يضيف هذا المشفّر 1–3 GB VRAM فوق ما يحتاجه النموذج الأساسي النصي فقط — ضع هذا الحمل الإضافي في حسبانك عند مراجعة ميزانية VRAM.

Llama 3.2 Vision معطّل حاليًا على Ollama. منذ أن انتقل Ollama v0.30.0 (مايو 2026) إلى تحميل النماذج عبر llama.cpp، أصبح llama3.2-vision يفشل بخطأ Error: unknown model architecture: "mllama" — لم تُضَف بنية mllama إلى llama.cpp قط. لا يزال هذا دون حل حتى إصدار Ollama v0.33.2 (أغسطس 2026). استخدم Qwen3-VL أو Gemma 4 بدلًا منه، أو احتفظ بتثبيت Ollama سابق لإصدار v0.30.0 إذا كنت بحاجة تحديدًا إلى Llama 3.2 Vision.

متطلبات VRAM للرؤية

كل نموذج رؤية يحتاج VRAM أكثر من نظيره النصي. يتطلب نموذج رؤية بحجم 7–8B عادةً 7–9 GB VRAM، وليس ~6 GB التي ستُخصصها لنموذج نصي بحجم مشابه.

لـ OCR والرسوم البيانية وتحليل المستندات، يُعد Qwen3-VL 8B الخيار القوي الأكثر كفاءة في VRAM. للرؤية واستدعاء الأدوات في نموذج واحد، تتسع نسختا Gemma 4 بحجم 12B أو 26B-A4B MoE ضمن 8–14 GB. للدليل الكامل حول نماذج اللغة المحلية متعددة الوسائط ومطابقة حالات الاستخدام، راجع دليل نماذج اللغة المحلية متعددة الوسائط.

الطرازVRAM بتحديد Q4قدرة معالجة الصور
LLaVA 7B~7 GBأسئلة وأجوبة عامة على الصور، توافق واسع
Qwen3-VL 8B~8 GBOCR، رسوم بيانية، لقطات شاشة، متعدد اللغات
Gemma 4 (12B)~8 GBرؤية + استدعاء أدوات
Gemma 4 (26B-A4B MoE)~14 GBرؤية + استدعاء أدوات، جودة أعلى
Llama 3.2 Vision 11B~10 GB⚠️ معطّل في Ollama v0.30.0+ (خطأ mllama)

أدلة ذات صلة

إجابات سريعة حول نماذج رؤية Ollama

كيف أرسل صورة إلى Ollama عبر الواجهة البرمجية؟
أرسل طلب POST إلى نقطة النهاية /api/chat مع الصورة كسلسلة base64 في مصفوفة images. نص JSON الأدنى المطلوب: {"model":"llava","messages":[{"role":"user","content":"What is in this image?","images":["<base64>"]}]} راجع Qwen 3 على Ollama لخيار متعدد الوسائط مع دعم قوي لاستدعاء الأدوات.
لماذا يفشل llama3.2-vision بخطأ "unknown model architecture: mllama"؟
انتقل Ollama v0.30.0 (مايو 2026) إلى تحميل النماذج عبر llama.cpp، الذي لم يحصل قط على دعم لبنية mllama التي يستخدمها Llama 3.2 Vision. هذا يعطّل llama3.2-vision على Ollama v0.30.0 وكل إصدار بعده، بما في ذلك v0.33.2. لا يوجد حل رسمي بعد: استخدم Qwen3-VL أو Gemma 4 بدلًا منه، أو احتفظ بتثبيت Ollama سابق لإصدار v0.30.0 لهذا النموذج تحديدًا.
هل تستطيع نماذج الرؤية إجراء OCR (قراءة النص من الصور)؟
نعم، لكن الجودة تتفاوت. Qwen3-VL هو الأقوى حاليًا في OCR بين نماذج رؤية Ollama العاملة — كان Llama 3.2 Vision الخيار السابق، لكنه معطّل على Ollama v0.30.0وما بعده. LLaVA 7B يستطيع قراءة النص المطبوع بوضوح، لكنه يواجه صعوبة مع الخط اليدوي أو الخطوط الصغيرة.
ما أفضل نموذج رؤية في Ollama للرسوم البيانية والمخططات؟
Qwen3-VL. يتصدر في الرسوم البيانية والجداول والمخططات وفهم لقطات الشاشة، ويتفوق على LLaVA وعلى جيل Qwen2.5-VL السابق في معايير فهم المستندات.
هل تدعم نماذج الرؤية صورًا متعددة في موجّه واحد؟
يتفاوت الدعم حسب النموذج وإصدار Ollama. يعالج LLaVA و Qwen2.5-VL حاليًا صورة واحدة لكل دور في Ollama. يدعم Qwen3-VL و Gemma 4 مدخلات صور متعددة في إعدادات السياق الأطول — تحقق من الحد الحالي في صفحة مكتبة Ollama الخاصة بكل نموذج.