Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/نماذج الرؤية في Ollama (2026): كيف تُشغّل نماذج الصور محليًا فعليًا
Voice, Speech & Multimodal

نماذج الرؤية في Ollama (2026): كيف تُشغّل نماذج الصور محليًا فعليًا

·12 دقيقة قراءة·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

يدعم Ollama تشغيل النماذج القادرة على الرؤية (متعددة الوسائط) محليًا، وذلك منذ الإصدار 0.1.15 في ديسمبر 2023. حتى وقت هذه المراجعة، تُدرج مكتبة نماذج Ollama نفسها LLaVA (وأشكاله llava-llama3/llava-phi3/bakllava)، وLlama 3.2 Vision، وQwen2.5-VL، وMiniCPM-V، وMoondream، وGranite 3.2 Vision، وGemma 3، وLlama 4، وMistral Small 3.1 بوصفها نماذج قادرة على الرؤية. نزّل أحدها عبر ollama pull llava، وشغّله عبر ollama run llava "describe this image: ./photo.jpg"، أو استدعه برمجيًا عبر /api/generate أو /api/chat مع صورة مُرمّزة بـ base64 ضمن مصفوفة images. يغطي هذا الدليل الأوامر الفعلية، وصيغة API الموثقة، وأين يكون Ollama الأداة الصحيحة وأين لا يكون — للاطلاع على مراجعة مخصصة لـ LLaVA تحديدًا، راجع مراجعة LLaVA من PromptQuorum.

أضاف Ollama، مُشغّل النماذج المحلي المبني فوق llama.cpp، دعم الوسائط المتعددة (إدخال الصور) في الإصدار 0.1.15 في ديسمبر 2023، وأعاد بناءه ليصبح محرك وسائط متعددة مخصصًا في مايو 2026. هذا الدليل مرجع عملي ومركّز لتشغيل النماذج القادرة على الرؤية عبر Ollama اليوم فعليًا: ما هي النماذج المدرجة حاليًا في مكتبته، وصيغة سطر الأوامر وواجهة HTTP API الفعلية لتمرير صورة، وإرشادات صريحة حول ما لا يصلح له Ollama. للاطلاع بعمق على نموذج محدد، راجع مراجعة LLaVA من PromptQuorum؛ ولمقارنة أوسع بين جميع نماذج الرؤية المحلية بغض النظر عن المُشغّل، راجع دليل نماذج الرؤية المحلية.

نماذج الرؤية في Ollama (2026): كيف تُشغّل نماذج الصور محليًا فعليًا

النقاط الرئيسية

  • أُضيف دعم الوسائط المتعددة في Ollama v0.1.15 (12 ديسمبر 2023)؛ وأُعيد بناؤه ليصبح محرك وسائط متعددة مخصصًا في مايو 2026.
  • نماذج قادرة على الرؤية تم التحقق منها ومدرجة حاليًا: LLaVA (بالإضافة إلى llava-llama3 وllava-phi3 وbakllava)، وLlama 3.2 Vision، وQwen2.5-VL، وMiniCPM-V، وMoondream، وGranite 3.2 Vision، وGemma 3، وLlama 4، وMistral Small 3.1.
  • سطر الأوامر: أشِر إلى مسار ملف الصورة مباشرة داخل نص طلب ollama run — لا توجد راية منفصلة.
  • واجهة HTTP: تقبل /api/generate و/api/chat صورة مُرمّزة بـ base64 ضمن مصفوفة images، موثقة في docs/api.md الخاص بـ Ollama نفسه.
  • Ollama مخصص للاستدلال فقط: يُشغّل النماذج، ولا يضبطها دقيقًا ولا يدربها.
  • مبني على llama.cpp منذ نشأة Ollama في منتصف 2023 (أُنشئ مستودع GitHub في 26 يونيو 2023، برخصة MIT)؛ ويدعم الآن أيضًا إطار MLX من Apple كخلفية بديلة على شرائح Apple Silicon.

📍 في جملة واحدة

يدعم Ollama تشغيل النماذج القادرة على الرؤية (متعددة الوسائط) محليًا منذ الإصدار 0.1.15 في ديسمبر 2023، ويُدرج حاليًا LLaVA وLlama 3.2 Vision وQwen2.5-VL وMiniCPM-V وMoondream وGranite 3.2 Vision وGemma 3 وLlama 4 وMistral Small 3.1 في مكتبته، ويدعم كلًا من سطر أوامر بسيط (الإشارة إلى مسار ملف صورة في الطلب) وواجهة HTTP API (صور مُرمّزة بـ base64 ضمن مصفوفة images بصيغة JSON).

💬 بعبارات بسيطة

Ollama هو الأداة التي تتيح لك تنزيل نماذج الذكاء الاصطناعي وتشغيلها على جهازك الخاص بأمر واحد، وبإمكان عدد من هذه النماذج أيضًا النظر إلى الصور والإجابة عن أسئلة بشأنها — يوضح هذا الدليل الأوامر واستدعاءات API الفعلية للقيام بذلك.

📌ملاحظة: تعكس قائمة النماذج أعلاه ما أكّده PromptQuorum مباشرة على ollama.com/library وقت إعداد هذه المراجعة. تتغير مكتبة Ollama؛ تحقق من الإدراج الحالي لأي نموذج قبل الاعتماد عليه — راجع قسم المصادر للاطلاع على روابط المكتبة الدقيقة التي تم فحصها.

التاريخ: Ollama وllama.cpp ودعم الوسائط المتعددة

**أُنشئ مستودع GitHub الخاص بـ Ollama في 26 يونيو 2023**، وهو مرخّص بموجب MIT. وهو يُغلّف llama.cpp، محرك الاستدلال بلغة C/C++ الخاص بالنماذج بصيغة GGUF، بواجهة سطر أوامر شبيهة بـ Docker وواجهة HTTP محلية — والقيمة الأساسية هي أن ollama run llama3 يُنزّل النموذج ويُشغّله دون أن يُضطر المستخدم لإدارة الاعتماديات أو تعريفات GPU أو محرك الاستدلال نفسه مباشرة.

**أُضيف دعم الوسائط المتعددة (إدخال الصور) في Ollama v0.1.15، الصادر في 12 ديسمبر 2023**، إلى جانب LLaVA كأول نموذج رؤية مدعوم. تصف ملاحظات الإصدار تشغيل ollama run llava ثم كتابة مسار ملف صورة مباشرة في الطلب التفاعلي، إضافة إلى معلمة images جديدة أُضيفت إلى نقطة نهاية HTTP الخاصة بـ /api/generate تقبل صور PNG أو JPEG مُرمّزة بـ base64 حتى 100 ميغابايت.

أعاد Ollama بناء دعم الوسائط المتعددة ليصبح محرك وسائط متعددة مخصصًا في حدود مايو 2026، وفقًا لمدونة Ollama نفسها، مضيفًا دعم رؤية من الدرجة الأولى لعائلات نماذج أحدث تشمل Llama 4 وGemma 3 وQwen2.5-VL وMistral Small 3.1 — مع معالجة خاصة بكل نموذج لدقة الصورة والبيانات الوصفية الموضعية وآليات الانتباه، بدلًا من النهج الأكثر عمومية المُستخدم في تكامل LLaVA الأصلي. جلب التحديث نفسه أيضًا تفريغ معالجة الرسوميات عبر Metal للنماذج متعددة الوسائط على شرائح Apple Silicon عبر خلفية llama.cpp.

يعمل Ollama بشكل أساسي على خلفية llama.cpp، ويدعم بشكل منفصل إطار MLX من Apple كخلفية بديلة على عتاد Apple Silicon، والذي يمكن لبعض النماذج متعددة الوسائط الأحدث استخدامه لتحسين الأداء على Mac.

متى أضاف Ollama دعم نماذج الرؤية؟

أضاف Ollama دعم الوسائط المتعددة (إدخال الصور) في الإصدار 0.1.15، الصادر في 12 ديسمبر 2023، وكان LLaVA أول نموذج رؤية مدعوم. وأعاد بناء ذلك ليصبح محرك وسائط متعددة مخصصًا في حدود مايو 2026 لعائلات نماذج أحدث مثل Llama 4 وGemma 3 وQwen2.5-VL وMistral Small 3.1.

نماذج الرؤية الموجودة فعليًا في مكتبة Ollama

تحقق PromptQuorum من كل نموذج من النماذج التالية مباشرة على ollama.com/library وقت إعداد هذه المراجعة — تعكس هذه القائمة ما يمكن تنزيله فعليًا اليوم، وليست مسحًا عامًا لنماذج الرؤية واللغة التي قد تكون أو لا تكون مُجهّزة لـ Ollama.

llava

الجهة المطوّرة:
جامعة ويسكونسن-ماديسون / مايكروسوفت للأبحاث / كولومبيا (بحثي)
ملاحظات:
7B/13B/34B؛ راجع مراجعة LLaVA المخصصة من PromptQuorum

llava-llama3 / llava-phi3 / bakllava

الجهة المطوّرة:
أشكال مطورة من المجتمع
ملاحظات:
نماذج بمعمارية LLaVA مضبوطة دقيقًا على نماذج لغوية أساسية مختلفة

llama3.2-vision

الجهة المطوّرة:
Meta
ملاحظات:
حجما 11B و90B؛ أداء قوي في الإجابة عن أسئلة الصور العامة

qwen2.5vl

الجهة المطوّرة:
Alibaba (فريق Qwen)
ملاحظات:
3B/7B/32B/72B؛ تعرف ضوئي على الحروف وفهم مستندات قويان

qwen3-vl

الجهة المطوّرة:
Alibaba (فريق Qwen)
ملاحظات:
2B إلى 235B؛ أحدث من qwen2.5vl، بسياق يصل إلى 256K، وهو أقوى خيار هنا للتعرف الضوئي/الوكيل البصري

minicpm-v

الجهة المطوّرة:
OpenBMB
ملاحظات:
~8B، ~5.5 غيغابايت؛ تعرف ضوئي قوي على المستندات بذاكرة VRAM منخفضة، ودعم صور متعددة

moondream

الجهة المطوّرة:
مستقل (Vikhyat K.)
ملاحظات:
1.8B، ~1.7 غيغابايت؛ أصغر خيار في هذه القائمة، للاستخدام الخفيف/على الحافة

granite3.2-vision

الجهة المطوّرة:
IBM
ملاحظات:
~2.4 غيغابايت؛ مضبوط لتحليل المستندات البصرية — الجداول والرسوم البيانية والإنفوغرافيك

gemma3

الجهة المطوّرة:
Google
ملاحظات:
الأحجام 4B/12B/27B متعددة الوسائط (270M و1B نصية فقط)

llama4

الجهة المطوّرة:
Meta
ملاحظات:
بنية خليط خبراء، متعددة الوسائط أصليًا؛ تنزيل كبير (67 غيغابايت فأكثر)

mistral-small3.1

الجهة المطوّرة:
Mistral AI
ملاحظات:
24B، ~15 غيغابايت؛ برخصة Apache-2.0، رؤية ونص معًا

تتحرك مكتبة Ollama بسرعة: انضم qwen3-vl بالفعل إلى qwen2.5vl بوصفه خيار رؤية أحدث وأقوى من Qwen (بسياق يصل إلى 256K) منذ كتابة بقية هذا المقال. نماذج لم يُتحقق من وجود صفحة مكتبة خاصة بها في Ollama وقت هذه المراجعة، رغم مناقشتها في أماكن أخرى بوصفها نماذج رؤية: qwen2-vl (استُبدل بـ qwen2.5vl) ومدخل مستقل باسم llava-next (تحسينات LLaVA-NeXT/1.6 مدمجة في قائمة llava نفسها). تحقق دائمًا من ollama.com/library/<الاسم> مباشرة قبل الاعتماد على اسم نموذج محدد — هذا الجدول لقطة زمنية، وليس تغذية مباشرة.

تنزيل نموذج رؤية وتشغيله: خطوة بخطوة

يستخدم هذا الشرح LLaVA كمثال، لكن الخطوات نفسها تنطبق على أي نموذج من الجدول أعلاه.

  1. 1
    ثبّت Ollama.
    Why it matters: نزّل [Ollama](https://ollama.com) لـ macOS أو Linux أو Windows. التثبيت عبارة عن مثبّت/حزمة قياسية ويستغرق أقل من دقيقتين.
  2. 2
    نزّل نموذج رؤية.
    Why it matters: شغّل `ollama pull llava` (أو `ollama pull qwen2.5vl` أو `ollama pull minicpm-v` وغيرها) — يُنزّل هذا أوزان النموذج، بحجم يتراوح من أقل من 2 غيغابايت (Moondream) إلى عشرات الغيغابايتات (Llama 4).
  3. 3
    شغّله مع الإشارة إلى صورة في الطلب.
    Why it matters: شغّل `ollama run llava "describe this image: ./photo.jpg"`. يكتشف Ollama مسار الملف `.jpg`/`.png` داخل نص الطلب ويُرفق الصورة تلقائيًا — يعمل هذا النمط منذ الإصدار v0.1.15 في ديسمبر 2023.
  4. 4
    أو استدعِ واجهة HTTP مباشرة.
    Why it matters: أرسل POST إلى `http://localhost:11434/api/generate` أو `/api/chat` مع الصورة مُرمّزة بـ base64 ضمن مصفوفة `images` — صيغة JSON الدقيقة موثقة في [docs/api.md](https://github.com/ollama/ollama/blob/main/docs/api.md) الخاص بـ Ollama نفسه، وموضحة في قسم أمثلة الاستخدام أدناه.
  5. 5
    (اختياري) استخدم مكتبات العميل الرسمية.
    Why it matters: تقبل مكتبتا `ollama` الرسميتان لـ Python وJavaScript مسار ملف صورة مباشرة وتتوليان ترميز base64 نيابة عنك، فتتجنب الترميز اليدوي في النصوص البرمجية.

أمثلة استخدام حقيقية: سطر الأوامر وHTTP API

هذه الأمثلة مأخوذة مباشرة من وثائق Ollama نفسها ومن صيغ طلب/استجابة تم التحقق منها — وليست صيغة مُختلقة.

  • لا توجد راية صورة منفصلة في سطر الأوامر. يكتشف Ollama مسار ملف .jpg/.png أو ما شابه داخل نص الطلب نفسه ويُرفقه تلقائيًا.
  • **تستخدم /api/generate الحقل prompt؛ وتستخدم /api/chat الحقل messages.** يقبل كلاهما مصفوفة images من سلاسل مُرمّزة بـ base64؛ وتدعم /api/chat محادثات متعددة الأدوار مع إرفاق صور برسائل فردية.
bash
# التنزيل والتشغيل عبر سطر الأوامر — أشِر إلى مسار الصورة مباشرة في الطلب
ollama pull llava
ollama run llava "describe this image: ./photo.jpg"

# --- HTTP API: /api/generate (موثق في docs/api.md الخاص بـ Ollama) ---
curl http://localhost:11434/api/generate -d '{
  "model": "llava",
  "prompt": "What is in this picture?",
  "stream": false,
  "images": ["<base64-encoded image data>"]
}'

# --- HTTP API: /api/chat (متعدد الأدوار، موثق أيضًا في docs/api.md) ---
curl http://localhost:11434/api/chat -d '{
  "model": "llava",
  "messages": [
    { "role": "user", "content": "What is in this image?", "images": ["<base64-encoded image data>"] }
  ]
}'

# --- Python: مكتبة ollama الرسمية (تتولى ترميز base64 نيابة عنك) ---
import ollama

response = ollama.chat(
    model="llava",
    messages=[{
        "role": "user",
        "content": "What is in this image?",
        "images": ["photo.jpg"],
    }],
)
print(response["message"]["content"])

# --- Python: استدعاء HTTP API مباشرة مع ترميز base64 يدوي ---
import base64
import requests

def ask_vision_model(image_path: str, prompt: str, model: str = "llava") -> str:
    with open(image_path, "rb") as f:
        image_b64 = base64.b64encode(f.read()).decode("utf-8")
    response = requests.post(
        "http://localhost:11434/api/generate",
        json={"model": model, "prompt": prompt, "images": [image_b64], "stream": False},
    )
    return response.json()["response"]

إرشادات VRAM والعتاد

تُدرج صفحات مكتبة نماذج Ollama نفسها حجم تنزيل كل نموذج، وهو مؤشر معقول لذاكرة VRAM أو RAM التي يحتاجها نموذج مُكمّم للعمل — لم يجد PromptQuorum جدول VRAM موثوقًا منشورًا بشكل منفصل من Ollama يتجاوز أحجام التنزيل هذه لكل نموذج.

النموذج
الحجم التقريبي
الحد الأدنى العملي
Moondream~1.7 غيغابايت4 غيغابايت VRAM / يعمل على عتاد متواضع
Granite 3.2 Vision~2.4 غيغابايت4-6 غيغابايت VRAM
LLaVA 7B / MiniCPM-V~4.7-5.5 غيغابايت6-8 غيغابايت VRAM
Llama 3.2 Vision 11B / Qwen2.5-VL 7B~6-8 غيغابايت8-10 غيغابايت VRAM
Mistral Small 3.1~15 غيغابايت16-24 غيغابايت VRAM
LLaVA 34B / Qwen2.5-VL 32B~20-21 غيغابايت24 غيغابايت VRAM فأكثر
Llama 3.2 Vision 90B / Llama 4~55-67 غيغابايت فأكثروحدات GPU متعددة أو Apple Silicon بذاكرة كبيرة

📌ملاحظة: هذه أحجام تنزيل تقريبية، وليست قياسات VRAM فعلية — لم يُجرِ PromptQuorum اختبارات عتاد خاصة به لهذا المقال. يمكن لنموذج أن يعمل على المعالج وحده بسرعة أبطأ بكثير إذا لم يتّسع في VRAM المتاحة؛ كما تعتمد هوامش VRAM القابلة للاستخدام فعليًا على طول السياق وحجم الدفعة.

ما لا يصلح له Ollama

يُعد Ollama وسيلة قوية ومُطوَّرة باستمرار لتشغيل النماذج القادرة على الرؤية محليًا، لكنه الأداة الخطأ في الحالات التالية:

  • ضبط نموذج دقيقًا أو تدريبه. Ollama مخصص للاستدلال فقط — يُشغّل أوزان نماذج مُدرَّبة مسبقًا، ولا يوفر خط أنابيب للتدريب أو الضبط الدقيق. إذا احتجت إلى ضبط نموذج رؤية-لغة دقيقًا على بياناتك الخاصة، فستحتاج إلى مجموعة أدوات مختلفة (مثل نصوص التدريب الخاصة بمستودع LLaVA الأصلي، أو إطار مثل Hugging Face Transformers).
  • القدرة الاحتكارية الأحدث متعددة الوسائط. مكتبة Ollama مبنية حول نماذج مفتوحة الأوزان. حتى وقت هذه المراجعة، تتفوق عمومًا واجهات الرؤية السحابية لـ GPT-4o وClaude وGemini على النماذج المحلية المفتوحة في فهم المشاهد المعقدة والتعرف على الخط اليدوي والصور الغامضة — Ollama هو الأداة الصحيحة للاستخدام الخاص والمُستضاف ذاتيًا بتكلفة هامشية صفرية لكل صورة، وليس لمضاهاة أحدث ما توصلت إليه التقنية.
  • استخراج أرقام دقيقة من الرسوم البيانية والمخططات. هذا قيد على نماذج الرؤية-اللغة الأساسية نفسها، وليس خاصًا بـ Ollama كمُشغّل — تحقق دائمًا من أي أرقام مستخرجة مقابل البيانات المصدرية بغض النظر عن النموذج أو المُشغّل المستخدم.
  • إجابة موحّدة واحدة عن "أي نموذج هو الأفضل". يعتمد اختيار نموذج الرؤية المناسب عبر Ollama على المهمة: Qwen2.5-VL لعمل مستندات كثيف التعرف الضوئي، وMiniCPM-V للتعرف الضوئي بذاكرة VRAM أقل، وLlama 3.2 Vision للإجابة العامة عن أسئلة الصور، وMoondream لأخف بصمة. راجع مقارنة نماذج الرؤية المحلية من PromptQuorum لإرشادات مفصّلة حسب المهمة.

بدائل Ollama لنماذج الرؤية

LM Studio

الأنسب لـ:
مُشغّل نماذج محلي يعتمد على الواجهة الرسومية أولًا؛ مُؤكَّد دعمه للنماذج القادرة على الرؤية مع إرفاق الصور في واجهة الدردشة
الرخصة:
مجاني، تطبيق احتكاري

llama.cpp مباشرة

الأنسب لـ:
أقصى تحكم منخفض المستوى في الاستدلال، بما في ذلك دعم الوسائط المتعددة (بأسلوب llava.cpp)، دون طبقة تغليف Ollama
الرخصة:
MIT

مستودع LLaVA نفسه

الأنسب لـ:
تحكم على مستوى بحثي، ونصوص تدريب/ضبط دقيق — راجع مراجعة LLaVA من PromptQuorum
الرخصة:
Apache-2.0 (الكود)؛ ويعتمد على النموذج الأساسي بالنسبة لنقاط التفتيش

MLC-LLM / MLC Chat

الأنسب لـ:
نشر نماذج لغوية على الجهاز عبر منصات متعددة؛ لم يجد PromptQuorum دعمًا موثقًا رسميًا ومؤكدًا لنماذج الرؤية-اللغة حتى وقت هذه المراجعة — تحقق من الوضع الحالي قبل الاعتماد عليه لمهام الرؤية
الرخصة:
Apache-2.0

واجهات VLM السحابية (GPT-4o، Claude، رؤية Gemini)

الأنسب لـ:
أعلى قدرة متعددة الوسائط متاحة، دون الحاجة إلى عتاد أو إعداد محلي
الرخصة:
احتكارية (API مدفوعة)

الأسئلة الشائعة

هل يدعم Ollama نماذج الرؤية؟

نعم. أضاف Ollama دعم الوسائط المتعددة (إدخال الصور) في الإصدار 0.1.15، الصادر في 12 ديسمبر 2023، وأعاد بناءه ليصبح محرك وسائط متعددة مخصصًا في حدود مايو 2026. حتى وقت هذه المراجعة، تُدرج مكتبته LLaVA وLlama 3.2 Vision وQwen2.5-VL وMiniCPM-V وMoondream وGranite 3.2 Vision وGemma 3 وLlama 4 وMistral Small 3.1 بوصفها نماذج قادرة على الرؤية.

كيف أُمرر صورة إلى نموذج في Ollama؟

من سطر الأوامر، أشِر إلى مسار ملف الصورة مباشرة داخل نص الطلب: ollama run llava "describe this image: ./photo.jpg". لا توجد راية --image منفصلة. برمجيًا، أرسل POST إلى /api/generate أو /api/chat مع الصورة مُرمّزة بـ base64 ضمن مصفوفة images، وفق docs/api.md الخاص بـ Ollama نفسه.

ما صيغة JSON الدقيقة لإرسال صورة إلى واجهة Ollama؟

لـ /api/generate: `{"model": "llava", "prompt": "...", "images": ["<base64 string>"]}. لـ /api/chat: {"model": "llava", "messages": [{"role": "user", "content": "...", "images": ["<base64 string>"]}]}. كلاهما موثق في مستودع Ollama على GitHub تحت docs/api.md`.

ما نماذج الرؤية المتاحة حاليًا في مكتبة Ollama؟

كما تم التحقق منه لهذه المراجعة: LLaVA (بالإضافة إلى أشكال llava-llama3 وllava-phi3 وbakllava)، وLlama 3.2 Vision، وQwen2.5-VL، وMiniCPM-V، وMoondream، وGranite 3.2 Vision، وGemma 3 (4B فأكبر)، وLlama 4، وMistral Small 3.1. تحقق مباشرة من ollama.com/library لأن هذه القائمة قد تتغير.

هل يمكن لـ Ollama ضبط نموذج رؤية دقيقًا؟

لا. Ollama مخصص للاستدلال فقط — يُشغّل أوزان نماذج مُدرَّبة مسبقًا لكنه لا يوفر خط أنابيب للتدريب أو الضبط الدقيق. يتطلب الضبط الدقيق مجموعة أدوات مختلفة، مثل نصوص التدريب الخاصة بالنموذج الأصلي نفسه أو إطار مثل Hugging Face Transformers.

هل Ollama مبني على llama.cpp؟

نعم. يُغلّف Ollama برنامج llama.cpp، محرك الاستدلال بلغة C/C++ الخاص بالنماذج بصيغة GGUF، بواجهة سطر أوامر أبسط وواجهة HTTP. أُنشئ مستودع Ollama على GitHub في 26 يونيو 2023. كما يدعم إطار MLX من Apple كخلفية بديلة على شرائح Apple Silicon.

كيف يقارن Ollama بواجهات الرؤية السحابية مثل GPT-4o أو Gemini؟

يُشغّل Ollama النماذج محليًا بتكلفة هامشية صفرية لكل طلب ويُبقي الصور على الجهاز، لكن مكتبته مبنية حول نماذج مفتوحة الأوزان، والتي عادةً ما تتخلف عن واجهات الرؤية السحابية الاحتكارية في فهم المشاهد المعقدة والخط اليدوي والصور الغامضة. اختر Ollama من أجل الخصوصية والتحكم بالتكلفة عند الحجم الكبير والاستخدام دون اتصال؛ واختر واجهة سحابية للحصول على أعلى قدرة متاحة.

الخلاصة

يوفر Ollama منذ ديسمبر 2023 مسارًا بسيطًا فعليًا لتشغيل النماذج القادرة على الرؤية محليًا، وأبقت إعادة بناء محرك الوسائط المتعددة في مايو 2026 تلك التجربة محدّثة لعائلات نماذج أحدث مثل Llama 4 وGemma 3 وQwen2.5-VL وMistral Small 3.1 إلى جانب خيارات راسخة مثل LLaVA. ظل سير العمل الأساسي — ollama pull ثم ollama run مع مسار صورة في الطلب، أو نقطتا نهاية HTTP الموثقتان /api/generate//api/chat — مستقرًا منذ إصدار v0.1.15 الأصلي، وهذا بحد ذاته نقطة لصالح Ollama لمن يبني فوقه. إنه ليس أداة تدريب، ولن يضاهي أحدث قدرة سحابية احتكارية متعددة الوسائط، لكن لفهم الصور بشكل خاص ومُستضاف ذاتيًا وبتكلفة هامشية صفرية، يظل واحدًا من أكثر نقاط الدخول العملية المتاحة. اقرن هذا الدليل مع مراجعة LLaVA من PromptQuorum للتعمق في نموذج محدد، أو مقارنة نماذج الرؤية المحلية لاختيار النموذج حسب المهمة عبر مشهد نماذج الرؤية المحلية بأكمله.

المصادر

← العودة إلى LLM المحلية المتقدمة