النقاط الرئيسية
- أُضيف دعم الوسائط المتعددة في Ollama v0.1.15 (12 ديسمبر 2023)؛ وأُعيد بناؤه ليصبح محرك وسائط متعددة مخصصًا في مايو 2026.
- نماذج قادرة على الرؤية تم التحقق منها ومدرجة حاليًا: LLaVA (بالإضافة إلى llava-llama3 وllava-phi3 وbakllava)، وLlama 3.2 Vision، وQwen2.5-VL، وMiniCPM-V، وMoondream، وGranite 3.2 Vision، وGemma 3، وLlama 4، وMistral Small 3.1.
- سطر الأوامر: أشِر إلى مسار ملف الصورة مباشرة داخل نص طلب
ollama run— لا توجد راية منفصلة. - واجهة HTTP: تقبل
/api/generateو/api/chatصورة مُرمّزة بـ base64 ضمن مصفوفةimages، موثقة فيdocs/api.mdالخاص بـ Ollama نفسه. - Ollama مخصص للاستدلال فقط: يُشغّل النماذج، ولا يضبطها دقيقًا ولا يدربها.
- مبني على llama.cpp منذ نشأة Ollama في منتصف 2023 (أُنشئ مستودع GitHub في 26 يونيو 2023، برخصة MIT)؛ ويدعم الآن أيضًا إطار MLX من Apple كخلفية بديلة على شرائح Apple Silicon.
📍 في جملة واحدة
يدعم Ollama تشغيل النماذج القادرة على الرؤية (متعددة الوسائط) محليًا منذ الإصدار 0.1.15 في ديسمبر 2023، ويُدرج حاليًا LLaVA وLlama 3.2 Vision وQwen2.5-VL وMiniCPM-V وMoondream وGranite 3.2 Vision وGemma 3 وLlama 4 وMistral Small 3.1 في مكتبته، ويدعم كلًا من سطر أوامر بسيط (الإشارة إلى مسار ملف صورة في الطلب) وواجهة HTTP API (صور مُرمّزة بـ base64 ضمن مصفوفة images بصيغة JSON).
💬 بعبارات بسيطة
Ollama هو الأداة التي تتيح لك تنزيل نماذج الذكاء الاصطناعي وتشغيلها على جهازك الخاص بأمر واحد، وبإمكان عدد من هذه النماذج أيضًا النظر إلى الصور والإجابة عن أسئلة بشأنها — يوضح هذا الدليل الأوامر واستدعاءات API الفعلية للقيام بذلك.
📌ملاحظة: تعكس قائمة النماذج أعلاه ما أكّده PromptQuorum مباشرة على ollama.com/library وقت إعداد هذه المراجعة. تتغير مكتبة Ollama؛ تحقق من الإدراج الحالي لأي نموذج قبل الاعتماد عليه — راجع قسم المصادر للاطلاع على روابط المكتبة الدقيقة التي تم فحصها.
التاريخ: Ollama وllama.cpp ودعم الوسائط المتعددة
**أُنشئ مستودع GitHub الخاص بـ Ollama في 26 يونيو 2023**، وهو مرخّص بموجب MIT. وهو يُغلّف llama.cpp، محرك الاستدلال بلغة C/C++ الخاص بالنماذج بصيغة GGUF، بواجهة سطر أوامر شبيهة بـ Docker وواجهة HTTP محلية — والقيمة الأساسية هي أن ollama run llama3 يُنزّل النموذج ويُشغّله دون أن يُضطر المستخدم لإدارة الاعتماديات أو تعريفات GPU أو محرك الاستدلال نفسه مباشرة.
**أُضيف دعم الوسائط المتعددة (إدخال الصور) في Ollama v0.1.15، الصادر في 12 ديسمبر 2023**، إلى جانب LLaVA كأول نموذج رؤية مدعوم. تصف ملاحظات الإصدار تشغيل ollama run llava ثم كتابة مسار ملف صورة مباشرة في الطلب التفاعلي، إضافة إلى معلمة images جديدة أُضيفت إلى نقطة نهاية HTTP الخاصة بـ /api/generate تقبل صور PNG أو JPEG مُرمّزة بـ base64 حتى 100 ميغابايت.
أعاد Ollama بناء دعم الوسائط المتعددة ليصبح محرك وسائط متعددة مخصصًا في حدود مايو 2026، وفقًا لمدونة Ollama نفسها، مضيفًا دعم رؤية من الدرجة الأولى لعائلات نماذج أحدث تشمل Llama 4 وGemma 3 وQwen2.5-VL وMistral Small 3.1 — مع معالجة خاصة بكل نموذج لدقة الصورة والبيانات الوصفية الموضعية وآليات الانتباه، بدلًا من النهج الأكثر عمومية المُستخدم في تكامل LLaVA الأصلي. جلب التحديث نفسه أيضًا تفريغ معالجة الرسوميات عبر Metal للنماذج متعددة الوسائط على شرائح Apple Silicon عبر خلفية llama.cpp.
يعمل Ollama بشكل أساسي على خلفية llama.cpp، ويدعم بشكل منفصل إطار MLX من Apple كخلفية بديلة على عتاد Apple Silicon، والذي يمكن لبعض النماذج متعددة الوسائط الأحدث استخدامه لتحسين الأداء على Mac.
متى أضاف Ollama دعم نماذج الرؤية؟
أضاف Ollama دعم الوسائط المتعددة (إدخال الصور) في الإصدار 0.1.15، الصادر في 12 ديسمبر 2023، وكان LLaVA أول نموذج رؤية مدعوم. وأعاد بناء ذلك ليصبح محرك وسائط متعددة مخصصًا في حدود مايو 2026 لعائلات نماذج أحدث مثل Llama 4 وGemma 3 وQwen2.5-VL وMistral Small 3.1.
نماذج الرؤية الموجودة فعليًا في مكتبة Ollama
تحقق PromptQuorum من كل نموذج من النماذج التالية مباشرة على ollama.com/library وقت إعداد هذه المراجعة — تعكس هذه القائمة ما يمكن تنزيله فعليًا اليوم، وليست مسحًا عامًا لنماذج الرؤية واللغة التي قد تكون أو لا تكون مُجهّزة لـ Ollama.
llava
- الجهة المطوّرة:
- جامعة ويسكونسن-ماديسون / مايكروسوفت للأبحاث / كولومبيا (بحثي)
- ملاحظات:
- 7B/13B/34B؛ راجع مراجعة LLaVA المخصصة من PromptQuorum
llava-llama3 / llava-phi3 / bakllava
- الجهة المطوّرة:
- أشكال مطورة من المجتمع
- ملاحظات:
- نماذج بمعمارية LLaVA مضبوطة دقيقًا على نماذج لغوية أساسية مختلفة
llama3.2-vision
- الجهة المطوّرة:
- Meta
- ملاحظات:
- حجما 11B و90B؛ أداء قوي في الإجابة عن أسئلة الصور العامة
qwen2.5vl
- الجهة المطوّرة:
- Alibaba (فريق Qwen)
- ملاحظات:
- 3B/7B/32B/72B؛ تعرف ضوئي على الحروف وفهم مستندات قويان
qwen3-vl
- الجهة المطوّرة:
- Alibaba (فريق Qwen)
- ملاحظات:
- 2B إلى 235B؛ أحدث من qwen2.5vl، بسياق يصل إلى 256K، وهو أقوى خيار هنا للتعرف الضوئي/الوكيل البصري
minicpm-v
- الجهة المطوّرة:
- OpenBMB
- ملاحظات:
- ~8B، ~5.5 غيغابايت؛ تعرف ضوئي قوي على المستندات بذاكرة VRAM منخفضة، ودعم صور متعددة
moondream
- الجهة المطوّرة:
- مستقل (Vikhyat K.)
- ملاحظات:
- 1.8B، ~1.7 غيغابايت؛ أصغر خيار في هذه القائمة، للاستخدام الخفيف/على الحافة
granite3.2-vision
- الجهة المطوّرة:
- IBM
- ملاحظات:
- ~2.4 غيغابايت؛ مضبوط لتحليل المستندات البصرية — الجداول والرسوم البيانية والإنفوغرافيك
gemma3
- الجهة المطوّرة:
- ملاحظات:
- الأحجام 4B/12B/27B متعددة الوسائط (270M و1B نصية فقط)
llama4
- الجهة المطوّرة:
- Meta
- ملاحظات:
- بنية خليط خبراء، متعددة الوسائط أصليًا؛ تنزيل كبير (67 غيغابايت فأكثر)
mistral-small3.1
- الجهة المطوّرة:
- Mistral AI
- ملاحظات:
- 24B، ~15 غيغابايت؛ برخصة Apache-2.0، رؤية ونص معًا
تتحرك مكتبة Ollama بسرعة: انضم qwen3-vl بالفعل إلى qwen2.5vl بوصفه خيار رؤية أحدث وأقوى من Qwen (بسياق يصل إلى 256K) منذ كتابة بقية هذا المقال. نماذج لم يُتحقق من وجود صفحة مكتبة خاصة بها في Ollama وقت هذه المراجعة، رغم مناقشتها في أماكن أخرى بوصفها نماذج رؤية: qwen2-vl (استُبدل بـ qwen2.5vl) ومدخل مستقل باسم llava-next (تحسينات LLaVA-NeXT/1.6 مدمجة في قائمة llava نفسها). تحقق دائمًا من ollama.com/library/<الاسم> مباشرة قبل الاعتماد على اسم نموذج محدد — هذا الجدول لقطة زمنية، وليس تغذية مباشرة.
تنزيل نموذج رؤية وتشغيله: خطوة بخطوة
يستخدم هذا الشرح LLaVA كمثال، لكن الخطوات نفسها تنطبق على أي نموذج من الجدول أعلاه.
- 1ثبّت Ollama.
Why it matters: نزّل [Ollama](https://ollama.com) لـ macOS أو Linux أو Windows. التثبيت عبارة عن مثبّت/حزمة قياسية ويستغرق أقل من دقيقتين. - 2نزّل نموذج رؤية.
Why it matters: شغّل `ollama pull llava` (أو `ollama pull qwen2.5vl` أو `ollama pull minicpm-v` وغيرها) — يُنزّل هذا أوزان النموذج، بحجم يتراوح من أقل من 2 غيغابايت (Moondream) إلى عشرات الغيغابايتات (Llama 4). - 3شغّله مع الإشارة إلى صورة في الطلب.
Why it matters: شغّل `ollama run llava "describe this image: ./photo.jpg"`. يكتشف Ollama مسار الملف `.jpg`/`.png` داخل نص الطلب ويُرفق الصورة تلقائيًا — يعمل هذا النمط منذ الإصدار v0.1.15 في ديسمبر 2023. - 4أو استدعِ واجهة HTTP مباشرة.
Why it matters: أرسل POST إلى `http://localhost:11434/api/generate` أو `/api/chat` مع الصورة مُرمّزة بـ base64 ضمن مصفوفة `images` — صيغة JSON الدقيقة موثقة في [docs/api.md](https://github.com/ollama/ollama/blob/main/docs/api.md) الخاص بـ Ollama نفسه، وموضحة في قسم أمثلة الاستخدام أدناه. - 5(اختياري) استخدم مكتبات العميل الرسمية.
Why it matters: تقبل مكتبتا `ollama` الرسميتان لـ Python وJavaScript مسار ملف صورة مباشرة وتتوليان ترميز base64 نيابة عنك، فتتجنب الترميز اليدوي في النصوص البرمجية.
أمثلة استخدام حقيقية: سطر الأوامر وHTTP API
هذه الأمثلة مأخوذة مباشرة من وثائق Ollama نفسها ومن صيغ طلب/استجابة تم التحقق منها — وليست صيغة مُختلقة.
- لا توجد راية صورة منفصلة في سطر الأوامر. يكتشف Ollama مسار ملف
.jpg/.pngأو ما شابه داخل نص الطلب نفسه ويُرفقه تلقائيًا. - **تستخدم
/api/generateالحقلprompt؛ وتستخدم/api/chatالحقلmessages.** يقبل كلاهما مصفوفةimagesمن سلاسل مُرمّزة بـ base64؛ وتدعم/api/chatمحادثات متعددة الأدوار مع إرفاق صور برسائل فردية.
# التنزيل والتشغيل عبر سطر الأوامر — أشِر إلى مسار الصورة مباشرة في الطلب
ollama pull llava
ollama run llava "describe this image: ./photo.jpg"
# --- HTTP API: /api/generate (موثق في docs/api.md الخاص بـ Ollama) ---
curl http://localhost:11434/api/generate -d '{
"model": "llava",
"prompt": "What is in this picture?",
"stream": false,
"images": ["<base64-encoded image data>"]
}'
# --- HTTP API: /api/chat (متعدد الأدوار، موثق أيضًا في docs/api.md) ---
curl http://localhost:11434/api/chat -d '{
"model": "llava",
"messages": [
{ "role": "user", "content": "What is in this image?", "images": ["<base64-encoded image data>"] }
]
}'
# --- Python: مكتبة ollama الرسمية (تتولى ترميز base64 نيابة عنك) ---
import ollama
response = ollama.chat(
model="llava",
messages=[{
"role": "user",
"content": "What is in this image?",
"images": ["photo.jpg"],
}],
)
print(response["message"]["content"])
# --- Python: استدعاء HTTP API مباشرة مع ترميز base64 يدوي ---
import base64
import requests
def ask_vision_model(image_path: str, prompt: str, model: str = "llava") -> str:
with open(image_path, "rb") as f:
image_b64 = base64.b64encode(f.read()).decode("utf-8")
response = requests.post(
"http://localhost:11434/api/generate",
json={"model": model, "prompt": prompt, "images": [image_b64], "stream": False},
)
return response.json()["response"]إرشادات VRAM والعتاد
تُدرج صفحات مكتبة نماذج Ollama نفسها حجم تنزيل كل نموذج، وهو مؤشر معقول لذاكرة VRAM أو RAM التي يحتاجها نموذج مُكمّم للعمل — لم يجد PromptQuorum جدول VRAM موثوقًا منشورًا بشكل منفصل من Ollama يتجاوز أحجام التنزيل هذه لكل نموذج.
النموذج | الحجم التقريبي | الحد الأدنى العملي |
|---|---|---|
| Moondream | ~1.7 غيغابايت | 4 غيغابايت VRAM / يعمل على عتاد متواضع |
| Granite 3.2 Vision | ~2.4 غيغابايت | 4-6 غيغابايت VRAM |
| LLaVA 7B / MiniCPM-V | ~4.7-5.5 غيغابايت | 6-8 غيغابايت VRAM |
| Llama 3.2 Vision 11B / Qwen2.5-VL 7B | ~6-8 غيغابايت | 8-10 غيغابايت VRAM |
| Mistral Small 3.1 | ~15 غيغابايت | 16-24 غيغابايت VRAM |
| LLaVA 34B / Qwen2.5-VL 32B | ~20-21 غيغابايت | 24 غيغابايت VRAM فأكثر |
| Llama 3.2 Vision 90B / Llama 4 | ~55-67 غيغابايت فأكثر | وحدات GPU متعددة أو Apple Silicon بذاكرة كبيرة |
📌ملاحظة: هذه أحجام تنزيل تقريبية، وليست قياسات VRAM فعلية — لم يُجرِ PromptQuorum اختبارات عتاد خاصة به لهذا المقال. يمكن لنموذج أن يعمل على المعالج وحده بسرعة أبطأ بكثير إذا لم يتّسع في VRAM المتاحة؛ كما تعتمد هوامش VRAM القابلة للاستخدام فعليًا على طول السياق وحجم الدفعة.
ما لا يصلح له Ollama
يُعد Ollama وسيلة قوية ومُطوَّرة باستمرار لتشغيل النماذج القادرة على الرؤية محليًا، لكنه الأداة الخطأ في الحالات التالية:
- ضبط نموذج دقيقًا أو تدريبه. Ollama مخصص للاستدلال فقط — يُشغّل أوزان نماذج مُدرَّبة مسبقًا، ولا يوفر خط أنابيب للتدريب أو الضبط الدقيق. إذا احتجت إلى ضبط نموذج رؤية-لغة دقيقًا على بياناتك الخاصة، فستحتاج إلى مجموعة أدوات مختلفة (مثل نصوص التدريب الخاصة بمستودع LLaVA الأصلي، أو إطار مثل Hugging Face Transformers).
- القدرة الاحتكارية الأحدث متعددة الوسائط. مكتبة Ollama مبنية حول نماذج مفتوحة الأوزان. حتى وقت هذه المراجعة، تتفوق عمومًا واجهات الرؤية السحابية لـ GPT-4o وClaude وGemini على النماذج المحلية المفتوحة في فهم المشاهد المعقدة والتعرف على الخط اليدوي والصور الغامضة — Ollama هو الأداة الصحيحة للاستخدام الخاص والمُستضاف ذاتيًا بتكلفة هامشية صفرية لكل صورة، وليس لمضاهاة أحدث ما توصلت إليه التقنية.
- استخراج أرقام دقيقة من الرسوم البيانية والمخططات. هذا قيد على نماذج الرؤية-اللغة الأساسية نفسها، وليس خاصًا بـ Ollama كمُشغّل — تحقق دائمًا من أي أرقام مستخرجة مقابل البيانات المصدرية بغض النظر عن النموذج أو المُشغّل المستخدم.
- إجابة موحّدة واحدة عن "أي نموذج هو الأفضل". يعتمد اختيار نموذج الرؤية المناسب عبر Ollama على المهمة: Qwen2.5-VL لعمل مستندات كثيف التعرف الضوئي، وMiniCPM-V للتعرف الضوئي بذاكرة VRAM أقل، وLlama 3.2 Vision للإجابة العامة عن أسئلة الصور، وMoondream لأخف بصمة. راجع مقارنة نماذج الرؤية المحلية من PromptQuorum لإرشادات مفصّلة حسب المهمة.
بدائل Ollama لنماذج الرؤية
LM Studio
- الأنسب لـ:
- مُشغّل نماذج محلي يعتمد على الواجهة الرسومية أولًا؛ مُؤكَّد دعمه للنماذج القادرة على الرؤية مع إرفاق الصور في واجهة الدردشة
- الرخصة:
- مجاني، تطبيق احتكاري
llama.cpp مباشرة
- الأنسب لـ:
- أقصى تحكم منخفض المستوى في الاستدلال، بما في ذلك دعم الوسائط المتعددة (بأسلوب llava.cpp)، دون طبقة تغليف Ollama
- الرخصة:
- MIT
مستودع LLaVA نفسه
- الأنسب لـ:
- تحكم على مستوى بحثي، ونصوص تدريب/ضبط دقيق — راجع مراجعة LLaVA من PromptQuorum
- الرخصة:
- Apache-2.0 (الكود)؛ ويعتمد على النموذج الأساسي بالنسبة لنقاط التفتيش
MLC-LLM / MLC Chat
- الأنسب لـ:
- نشر نماذج لغوية على الجهاز عبر منصات متعددة؛ لم يجد PromptQuorum دعمًا موثقًا رسميًا ومؤكدًا لنماذج الرؤية-اللغة حتى وقت هذه المراجعة — تحقق من الوضع الحالي قبل الاعتماد عليه لمهام الرؤية
- الرخصة:
- Apache-2.0
واجهات VLM السحابية (GPT-4o، Claude، رؤية Gemini)
- الأنسب لـ:
- أعلى قدرة متعددة الوسائط متاحة، دون الحاجة إلى عتاد أو إعداد محلي
- الرخصة:
- احتكارية (API مدفوعة)
الأسئلة الشائعة
هل يدعم Ollama نماذج الرؤية؟
نعم. أضاف Ollama دعم الوسائط المتعددة (إدخال الصور) في الإصدار 0.1.15، الصادر في 12 ديسمبر 2023، وأعاد بناءه ليصبح محرك وسائط متعددة مخصصًا في حدود مايو 2026. حتى وقت هذه المراجعة، تُدرج مكتبته LLaVA وLlama 3.2 Vision وQwen2.5-VL وMiniCPM-V وMoondream وGranite 3.2 Vision وGemma 3 وLlama 4 وMistral Small 3.1 بوصفها نماذج قادرة على الرؤية.
كيف أُمرر صورة إلى نموذج في Ollama؟
من سطر الأوامر، أشِر إلى مسار ملف الصورة مباشرة داخل نص الطلب: ollama run llava "describe this image: ./photo.jpg". لا توجد راية --image منفصلة. برمجيًا، أرسل POST إلى /api/generate أو /api/chat مع الصورة مُرمّزة بـ base64 ضمن مصفوفة images، وفق docs/api.md الخاص بـ Ollama نفسه.
ما صيغة JSON الدقيقة لإرسال صورة إلى واجهة Ollama؟
لـ /api/generate: `{"model": "llava", "prompt": "...", "images": ["<base64 string>"]}. لـ /api/chat: {"model": "llava", "messages": [{"role": "user", "content": "...", "images": ["<base64 string>"]}]}. كلاهما موثق في مستودع Ollama على GitHub تحت docs/api.md`.
ما نماذج الرؤية المتاحة حاليًا في مكتبة Ollama؟
كما تم التحقق منه لهذه المراجعة: LLaVA (بالإضافة إلى أشكال llava-llama3 وllava-phi3 وbakllava)، وLlama 3.2 Vision، وQwen2.5-VL، وMiniCPM-V، وMoondream، وGranite 3.2 Vision، وGemma 3 (4B فأكبر)، وLlama 4، وMistral Small 3.1. تحقق مباشرة من ollama.com/library لأن هذه القائمة قد تتغير.
هل يمكن لـ Ollama ضبط نموذج رؤية دقيقًا؟
لا. Ollama مخصص للاستدلال فقط — يُشغّل أوزان نماذج مُدرَّبة مسبقًا لكنه لا يوفر خط أنابيب للتدريب أو الضبط الدقيق. يتطلب الضبط الدقيق مجموعة أدوات مختلفة، مثل نصوص التدريب الخاصة بالنموذج الأصلي نفسه أو إطار مثل Hugging Face Transformers.
هل Ollama مبني على llama.cpp؟
نعم. يُغلّف Ollama برنامج llama.cpp، محرك الاستدلال بلغة C/C++ الخاص بالنماذج بصيغة GGUF، بواجهة سطر أوامر أبسط وواجهة HTTP. أُنشئ مستودع Ollama على GitHub في 26 يونيو 2023. كما يدعم إطار MLX من Apple كخلفية بديلة على شرائح Apple Silicon.
كيف يقارن Ollama بواجهات الرؤية السحابية مثل GPT-4o أو Gemini؟
يُشغّل Ollama النماذج محليًا بتكلفة هامشية صفرية لكل طلب ويُبقي الصور على الجهاز، لكن مكتبته مبنية حول نماذج مفتوحة الأوزان، والتي عادةً ما تتخلف عن واجهات الرؤية السحابية الاحتكارية في فهم المشاهد المعقدة والخط اليدوي والصور الغامضة. اختر Ollama من أجل الخصوصية والتحكم بالتكلفة عند الحجم الكبير والاستخدام دون اتصال؛ واختر واجهة سحابية للحصول على أعلى قدرة متاحة.
الخلاصة
يوفر Ollama منذ ديسمبر 2023 مسارًا بسيطًا فعليًا لتشغيل النماذج القادرة على الرؤية محليًا، وأبقت إعادة بناء محرك الوسائط المتعددة في مايو 2026 تلك التجربة محدّثة لعائلات نماذج أحدث مثل Llama 4 وGemma 3 وQwen2.5-VL وMistral Small 3.1 إلى جانب خيارات راسخة مثل LLaVA. ظل سير العمل الأساسي — ollama pull ثم ollama run مع مسار صورة في الطلب، أو نقطتا نهاية HTTP الموثقتان /api/generate//api/chat — مستقرًا منذ إصدار v0.1.15 الأصلي، وهذا بحد ذاته نقطة لصالح Ollama لمن يبني فوقه. إنه ليس أداة تدريب، ولن يضاهي أحدث قدرة سحابية احتكارية متعددة الوسائط، لكن لفهم الصور بشكل خاص ومُستضاف ذاتيًا وبتكلفة هامشية صفرية، يظل واحدًا من أكثر نقاط الدخول العملية المتاحة. اقرن هذا الدليل مع مراجعة LLaVA من PromptQuorum للتعمق في نموذج محدد، أو مقارنة نماذج الرؤية المحلية لاختيار النموذج حسب المهمة عبر مشهد نماذج الرؤية المحلية بأكمله.
المصادر
- Ollama على GitHub — تاريخ إنشاء المستودع، والرخصة، وسجل الإصدارات.
- ملاحظات إصدار Ollama v0.1.15 — الإعلان الأصلي لدعم الوسائط المتعددة/LLaVA، 12 ديسمبر 2023.
- محرك Ollama الجديد للنماذج متعددة الوسائط — إعادة بناء محرك الوسائط المتعددة في مايو 2026، ويغطي Llama 4 وGemma 3 وQwen2.5-VL وMistral Small 3.1.
- وثائق واجهة Ollama — صيغة الطلب/الاستجابة الموثقة لـ
/api/generateو/api/chatالخاصة بالصور. - مكتبة نماذج Ollama — المكتبة الحية المستخدمة للتحقق من كل نموذج مذكور في هذا المقال، بما في ذلك صفحات مستقلة لـ llava وllama3.2-vision وqwen2.5vl وminicpm-v وmoondream وgranite3.2-vision وgemma3 وllama4 وmistral-small3.1.
