Key Takeaways
- متعدد الوسائط = نص + صور (+ صوت). يعالج الصور أصليًا دون معالجة OCR مسبقة.
- أفضل النماذج (2026): Llama 3.2 Vision 11B، Qwen2-VL 7B، Gemma 4 E2B.
- حالات الاستخدام: OCR للمستندات، تحليل الصور، الأسئلة والأجوبة البصرية، استخراج الجداول.
- السرعة: 2-5 ثوانٍ لكل صورة (نموذج 11B). أبطأ من النص وحده، لكنه عملي.
- تعدد الوسائط ناضج لحالات استخدام محددة، لكنه ليس للأغراض العامة بعد.
تعالج النماذج المحلية متعددة الوسائط مثل Llama 3.2 Vision وGemma 4 وQwen2-VL الصور والنص والصوت معاً، مما يتيح OCR للمستندات وتحليل الصور والأسئلة والأجوبة البصرية دون اتصال بالإنترنت وبلا واجهات API سحابية.
النموذج متعدد الوسائط لا يقتصر على النص -- يمكنك عرض صورة، أو مستند ممسوح ضوئياً، أو لقطة شاشة عليه وطرح أسئلة حولها. يعمل هذا محلياً، لذا لا تحتاج صورة إيصال أو صفحة ملاحظات مكتوبة بخط اليد إلى مغادرة جهازك ليتم قراءتها وتلخيصها.
النماذج متعددة الوسائط المتاحة
Modelo | Soporte de imagen | VRAM | Velocidad por imagen | Mejor para |
|---|---|---|---|---|
| Llama 3.2 Vision 11B | نعم | 8 GB | 3-5 ث/صورة | رؤية عامة |
| Qwen2-VL 7B | نعم | 5 GB | 2-3 ث/صورة | رؤية سريعة |
| Gemma 4 E2B | نعم | ~2 GB | 1-2 ث/صورة | أصغر عتاد / edge |
| Llama 3.2 Vision 90B | نعم | 55 GB | 10+ ث/صورة | جودة عالية |
قدرات الرؤية
يمكن للنماذج متعددة الوسائط:
- وصف الصور: يشرح ما في الصورة.
- OCR (التعرّف الضوئي على الحروف): يستخرج النص من الصور (بطاقة عمل، مسح مستند).
- أسئلة وأجوبة بصرية: يجيب عن أسئلة حول الصور ("ما ماركة السيارة؟").
- استخراج الجداول: يحلّل جداول الصور إلى بيانات منظّمة.
- تحليل الرسوم البيانية: يفسّر تصورات البيانات.
- كشف الكائنات: يحدّد ويوضّع الكائنات في الصور.
الإعداد والاستخدام
باستخدام Llama 3.2 Vision مع Ollama:
# Pull the model
ollama pull llama3.2-vision:11b
# Use it
from ollama import Client
client = Client()
with open("image.jpg", "rb") as f:
image_data = f.read()
response = client.generate(
model="llama3.2-vision:11b",
prompt="Describe this image",
images=[image_data] # Pass image data
)
print(response["response"])حالات استخدام حقيقية
- معالجة المستندات: يستخرج النص من ملفات PDF الممسوحة دون خدمة OCR خارجية.
- الإشراف على المحتوى: يضع علامة على الصور غير اللائقة دون إرسالها للسحابة.
- إمكانية الوصول: يصف الصور للمستخدمين ذوي الإعاقة البصرية.
- تحليل المنتجات: يحلّل صور المنتجات في التجارة الإلكترونية (الفئة، الحالة، العيوب).
- البحث: يحلّل الرسوم البيانية والمخططات العلمية.
الأداء والقيود
الدقة: جيدة لـ OCR المستندات والوصف، لكنها ليست مثالية للتحليل التفصيلي أو الكائنات الصغيرة.
السرعة: 2-5 ثوانٍ لكل صورة. النماذج السحابية (GPT-4 Vision) أسرع بمقدار 10-50×.
حجم الصورة: يدعم حتى ~1000×1000 بكسل. الصور الأكبر يُخفَّض معدل أخذ عيناتها.
القيود: لا يمكنه مضاهاة دقة GPT-4 Vision في المشاهد المعقدة. المقايضة: الخصوصية مقابل الجودة.
أخطاء شائعة
- توقّع دقة GPT-4 Vision. النماذج المحلية أقل دقة بنسبة 20-30%. استخدمها لمجالات محددة، لا للرؤية العامة.
- عدم تجهيز الصور. اقتصّ الصور إلى منطقة التركيز. أزل الضوضاء. إدخال أفضل = إخراج أفضل.
- استخدام نماذج 7B للرؤية المعقدة. النماذج الصغيرة تكافح مع التفاصيل الدقيقة. استخدم 11B+ للرؤية الموثوقة.
المصادر
- بطاقة نموذج Llama 3.2 Vision -- huggingface.co/meta-llama/Llama-3.2-11B-Vision
- Qwen2-VL -- github.com/QwenLM/Qwen2-VL
