النقاط الرئيسية
- توجد ثلاثة أجيال: Idefics (2023)، وIdefics2 (أبريل 2024)، وIdefics3 (أغسطس 2024) — كل منها نموذج مستقل، وليس مجرد ترقية بسيطة.
- Idefics3 هو التوصية الحالية لمعظم المهام؛ ويحسّن بشكل كبير التعرف الضوئي وفهم المستندات مقارنة بـ Idefics2.
- الترخيص دقيق عبر الأجيال: يحمل Idefics الأصلي قيدًا للأبحاث فقط؛ وIdefics2 خاضع بالكامل لرخصة Apache-2.0 (قاعدة Mistral-7B)؛ ويحمل Idefics3 شروط رخصة Llama 3.1 المجتمعية إلى جانب علامة Apache-2.0 (قاعدة Llama-3.1-8B-Instruct).
- VRAM: نحو 18-20 غيغابايت بصيغة float16 لـ Idefics2/3، أو 6-7 غيغابايت مع التكميم القوي — أثقل من LLaVA 7B أو MiniCPM-V.
- غير معبأ في مكتبة Ollama حتى وقت هذه المراجعة؛ وتتابع طلبات GitHub المفتوحة صعوبات تحويل GGUF.
- الأنسب لـ: مهام التعرف الضوئي المكثفة على المستندات والاستدلال متعدد الصور مع ذاكرة GPU كافية، وليس الإعدادات المحلية محدودة الموارد أو الفورية.
📍 في جملة واحدة
Idefics هو نسخة HuggingFace M4 المفتوحة من Flamingo الخاص بـ DeepMind، وقد وصل الآن إلى جيله الثالث (Idefics3، 8B، أغسطس 2024)، مع اختلافات ملحوظة في الترخيص ومتطلبات VRAM بين إصداراته الثلاثة، وهو غير معبأ حاليًا في مكتبة نماذج Ollama.
💬 بعبارات بسيطة
Idefics عائلة نماذج ذكاء اصطناعي من HuggingFace يمكنها النظر إلى الصور والإجابة عن أسئلة بشأنها، على غرار LLaVA — توضح هذه المراجعة أي الإصدارات الثلاثة يجب استخدامه فعليًا، وتكلفته من ذاكرة GPU، وأين يقصر.
📌ملاحظة: تحقق PromptQuorum من هذه الحقائق مباشرة من بطاقات نماذج HuggingFace الخاصة بـ idefics-80b وidefics2-8b وIdefics3-8B-Llama3، ومن مكتبة Ollama ومتتبع طلبات GitHub الخاص بها — راجع قسم المصادر للروابط الدقيقة.
التاريخ: HuggingFace M4 ونسخة Flamingo
**تنص بطاقة نموذج Idefics الأصلي صراحةً على أنه "نسخة مفتوحة الوصول من Flamingo، وهو نموذج رؤية-لغة مغلق المصدر طورته DeepMind."** أُصدر من قبل فريق M4 التابع لـ HuggingFace عام 2023 بحجمين، 9B و80B معلمة، يجمع بين مُرمّز رؤية وقاعدة نموذج لغوي LLaMA(1).
يحمل Idefics الأصلي رخصة مختلطة، وليست رخصة تساهلية واحدة. يُطرح مُرمّز الرؤية ومعاملات الربط المُدرّبة حديثًا تحت رخصة MIT، لكن قاعدة النموذج اللغوي LLaMA(1) تتطلب الالتزام برخصة Meta الأصلية الخاصة بالأبحاث فقط وغير التجارية لـ LLaMA. هذا يجعل Idefics الأصلي غير مناسب للاستخدام التجاري في معظم الحالات، بصرف النظر عن علامة MIT على أجزاء من المكدس.
استبدل Idefics2 (8B)، الذي صدر حوالي أبريل 2024، قاعدة LLaMA(1) بـ Mistral-7B-v0.1 وجمعه مع مُرمّز رؤية SigLIP. ولأن كلا النموذجين الأساسيين برخصة Apache-2.0، تنص بطاقة نموذج Idefics2 نفسه على أن النموذج بأكمله برخصة Apache-2.0 — ما يحل مشكلة ترخيص Idefics الأصلي. تنسب HuggingFace نفسها إلى Idefics2 مطابقة أداء Idefics-80B بحجم أصغر بنحو عشر مرات، مع تعرف ضوئي وفهم مستندات أفضل بشكل ملحوظ.
احتفظ Idefics3 (8B)، الذي صدر في 22 أغسطس 2024، بمُرمّز الرؤية SigLIP، لكنه بدّل القاعدة اللغوية إلى Meta-Llama-3.1-8B-Instruct. تُظهر بطاقة نموذجه الخاصة تحسنًا كبيرًا مقارنة بـ Idefics2، خصوصًا في فهم المستندات والتعرف الضوئي والاستدلال البصري. أُضيف إلى Hugging Face Transformers في الإصدار 4.46.
هل Idefics نسخة من Flamingo الخاص بـ DeepMind؟
نعم. تصف بطاقة نموذج Idefics الأصلي صراحةً بأنه "نسخة مفتوحة الوصول من Flamingo، وهو نموذج رؤية-لغة مغلق المصدر طورته DeepMind." وIdefics2 وIdefics3 أجيال لاحقة من HuggingFace M4، بُنيت بمعمارية مستقلة ضمن السلالة نفسها.
Idefics مقابل Idefics2 مقابل Idefics3: ما الذي تغيّر فعليًا
الأجيال الثلاثة نماذج مستقلة بمعماريات أساسية مختلفة — وليست نموذجًا واحدًا بترقيات إصدار تدريجية. إليك ما يختلف فعليًا، تم التحقق منه في بطاقة HuggingFace الخاصة بكل نموذج.
Idefics (9B/80B)
- الإصدار (تاريخ):
- 2023
- القاعدة:
- LLaMA(1) + مُرمّز رؤية مخصص
- ملاحظات:
- قيد ترخيص للأبحاث فقط موروث من LLaMA(1)؛ متجاوز إلى حد كبير
Idefics2 (8B)
- الإصدار (تاريخ):
- أبريل 2024
- القاعدة:
- Mistral-7B-v0.1 + SigLIP
- ملاحظات:
- خاضع بالكامل لرخصة Apache-2.0؛ يطابق Idefics-80B بحجم أصغر بعشر مرات
Idefics3 (8B)
- الإصدار (تاريخ):
- 22 أغسطس 2024
- القاعدة:
- Llama-3.1-8B-Instruct + SigLIP
- ملاحظات:
- أفضل تعرف ضوئي/فهم مستندات بين الثلاثة؛ تنطبق شروط ترخيص Llama 3.1
لم يجد PromptQuorum أي "Idefics4" مؤكد علنًا حتى وقت هذه المراجعة. Idefics3 هو أحدث جيل والتوصية الحالية لمعظم المهام.
فرق الترخيص: ليس مجرد Apache-2.0
يضع دليل PromptQuorum علامة على ترخيص Idefics بأنه "Apache 2.0" — وهذا صحيح بالنسبة لمستودع النموذج والكود، لكنه غير مكتمل بالنسبة للوضع العملي للترخيص، على غرار كون رخصة كود LLaVA Apache-2.0 لا تمتد تلقائيًا إلى كل نقطة تفتيش نموذج أساسي.
Idefics2 هو الحالة الأوضح: كل من قاعدته اللغوية Mistral-7B-v0.1 ومُرمّز الرؤية SigLIP برخصة Apache-2.0، لذا فإن مكدس النموذج بأكمله فعليًا برخصة Apache-2.0 دون شروط إضافية.
Idefics3 أكثر دقة. مستودعه الخاص على HuggingFace موسوم بـ Apache-2.0، لكن قاعدته اللغوية، Meta-Llama-3.1-8B-Instruct، تُطرح تحت رخصة Llama 3.1 المجتمعية من Meta — التي تتضمن سياسة استخدام مقبول وبندًا يشترط الحصول على رخصة منفصلة من Meta إذا تجاوز منتج تابع 700 مليون مستخدم نشط شهريًا. على من ينشر Idefics3 تجاريًا على نطاق واسع قراءة شروط رخصة Llama 3.1 من Meta مباشرة، وليس فقط علامة Apache-2.0 في مستودع Idefics3.
Idefics الأصلي هو الأكثر تقييدًا. تحمل قاعدته LLaMA(1) رخصة Meta الأصلية الخاصة بالأبحاث فقط وغير التجارية، ما يجعل الاستخدام التجاري للنموذج الكامل 9B/80B غير واضح قانونيًا في أفضل الأحوال وغير متاح في أسوئها — حتى لو كانت أوزان مُرمّز الرؤية والوصل مرخصة بشكل منفصل تحت MIT.
هل Idefics مجاني للاستخدام التجاري؟
يعتمد ذلك على الجيل. Idefics2 خاضع بالكامل لرخصة Apache-2.0 دون قيود إضافية. مستودع Idefics3 نفسه برخصة Apache-2.0، لكن قاعدته Llama-3.1-8B-Instruct تحمل شروط رخصة Llama 3.1 المجتمعية من Meta، بما في ذلك شرط ترخيص منفصل فوق 700 مليون مستخدم نشط شهريًا. يحمل Idefics الأصلي قيدًا للأبحاث فقط وغير تجاري من قاعدته LLaMA(1).
مثال استخدام حقيقي: مكتبة Transformers
يُستخدم Idefics3 عبر صنفي AutoModelForVision2Seq وAutoProcessor من Hugging Face Transformers، الموثقين في وثائق نموذج Idefics3 الخاصة بـ Transformers. يلزم إصدار Transformers 4.46 أو أحدث.
- لا يوجد اليوم مسار عبر Ollama أو llama.cpp. يعمل Idefics عبر Transformers (أو خوادم استدلال متوافقة مثل Text Generation Inference)، وليس عبر مُشغّلات قائمة على GGUF.
- تقليل معامل دقة الصورة يمكن أن يخفض استهلاك ذاكرة GPU. توثق بطاقات نماذج Idefics2/3 تقليل عدد أجزاء الصورة الفرعية المعالجة (يُشار إليه بـ
Nفي وثائق Idefics3) كوسيلة لمقايضة بعض الدقة مقابل VRAM أقل.
# يتطلب transformers >= 4.46 (وفق وثائق نموذج Idefics3 من Hugging Face)
# pip install transformers pillow torch
from transformers import AutoProcessor, AutoModelForVision2Seq
from PIL import Image
import torch
model_id = "HuggingFaceM4/Idefics3-8B-Llama3"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForVision2Seq.from_pretrained(
model_id,
torch_dtype=torch.float16,
).to("cuda")
image = Image.open("photo.jpg")
messages = [
{
"role": "user",
"content": [
{"type": "image"},
{"type": "text", "text": "What is in this image?"},
],
},
]
prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
inputs = processor(text=prompt, images=[image], return_tensors="pt").to("cuda")
generated_ids = model.generate(**inputs, max_new_tokens=200)
generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)
print(generated_text[0])متطلبات VRAM والعتاد
يُعد Idefics2 وIdefics3 أثقل بشكل ملحوظ من نقاط تفتيش LLaVA أو MiniCPM-V بحجم مماثل، ويرجع ذلك إلى حد كبير إلى طريقة معالجتهما لدقة الصورة. تأتي هذه الأرقام مباشرة من بطاقة نموذج Idefics2 نفسه، التي توثق نطاق VRAM الخاص به صراحة؛ ومن المتوقع أن يكون Idefics3 (بنفس عدد المعلمات 8B ونفس مُرمّز الرؤية) مشابهًا، رغم أن PromptQuorum لم يجد جدول VRAM منشورًا بنفس التفصيل خصيصًا لـ Idefics3.
الإعداد | VRAM تقريبي | ملاحظات |
|---|---|---|
| float16 + flash-attention | ~18-20 غيغابايت | موثق في بطاقة نموذج Idefics2 كإعداد قياسي |
| بدون تحسينات | حتى ~55 غيغابايت في الذروة | الحد الأعلى في بطاقة نموذج Idefics2 للاستدلال غير المُحسَّن |
| تكميم قوي | ~6-7 غيغابايت | الحد الأدنى الموثق في بطاقة نموذج Idefics2؛ توقع مقايضة في الدقة |
| LLaVA 7B (للمقارنة) | ~6-8 غيغابايت | راجع مراجعة LLaVA من PromptQuorum |
📌ملاحظة: لم يُجرِ PromptQuorum اختبارات عتاد خاصة به لهذا المقال؛ هذه الأرقام مأخوذة من بطاقة نموذج Idefics2 المنشورة. Idefics فعليًا أثقل من LLaVA 7B أو MiniCPM-V عند مستويات قدرة مماثلة — كن صريحًا مع نفسك بشأن VRAM المتاح قبل اختياره لنشر محدود الموارد.
ما لا يصلح له Idefics
Idefics3 نموذج رؤية-لغة مفتوح قادر، لكنه الخيار الخطأ في الحالات التالية:
- الإعدادات المحلية محدودة الموارد. باستهلاك نحو 18-20 غيغابايت من VRAM في إعداده القياسي float16، يحتاج Idefics2/3 ذاكرة GPU أكثر بشكل ملحوظ من LLaVA 7B (~6-8 غيغابايت) أو MiniCPM-V (~5.5 غيغابايت). إذا كانت ميزانية العتاد لديك بطاقة رسوميات استهلاكية واحدة بـ 8 غيغابايت من VRAM أو أقل، فإن Idefics ليس خيارًا واقعيًا دون تكميم قوي وقبول مقايضة في الدقة.
- تطبيقات الوقت الفعلي أو ذات زمن الاستجابة المنخفض. نموذج رؤية-لغة بحجم 8B معلمة يعالج أجزاء صورة فرعية متعددة لكل إدخال لم يُبنَ لأسرع وقت استجابة ممكن. إذا كانت الأولوية للزمن، فسيستجيب نموذج أصغر مثل Moondream (1.8B) بسرعة أكبر، مع قدرة أقل.
- سير عمل مباشر مع Ollama أو llama.cpp. لا يُعبّأ Idefics حاليًا في مكتبة Ollama، ولتحويل GGUF مشكلات توافق مفتوحة وغير محلولة تُتابع على GitHub الخاص بـ Ollama نفسه. إذا كان سير عملك يعتمد على Ollama تحديدًا، راجع دليل نماذج رؤية Ollama من PromptQuorum للنماذج القابلة للتنزيل فعليًا اليوم.
- افتراض رخصة واحدة موحدة عبر الإصدارات. التعامل مع "Idefics" كمنتج واحد برخصة واحدة خطأ — تحقق من الجيل الذي تنشره واقرأ شروط الترخيص الخاصة بذلك النموذج تحديدًا، خصوصًا التزامات رخصة Llama 3.1 المجتمعية لـ Idefics3 على نطاق واسع.
البدائل والمنافسون
LLaVA
- الأنسب لـ:
- دعم أدوات أوسع، بما في ذلك التعبئة لـ Ollama وllama.cpp؛ بصمة VRAM أخف عند 7B
- الرخصة:
- Apache-2.0 (الكود)؛ ويعتمد على النموذج الأساسي بالنسبة لنقاط التفتيش
نماذج رؤية Ollama
- الأنسب لـ:
- أبسط إعداد محلي عبر
ollama pull/ollama run؛ لا يندرج Idefics ضمنها حتى وقت هذه المراجعة - الرخصة:
- تختلف حسب النموذج
MLC Chat
- الأنسب لـ:
- نشر على الجهاز عبر منصات متعددة؛ مركّز بشكل أساسي على النص حتى وقت هذه المراجعة — تحقق من دعم الرؤية الحالي قبل الاعتماد عليه
- الرخصة:
- Apache-2.0
مقالات حول MLC Chat (5)
- MLC Chat Review (2026): The Mobile App Built on MLC LLM, Assessed Honestlyمحدَّث ٧ سبتمبر ٢٠٢٦
- Best Local LLM Apps for iPhone in 2026 (Run AI Without WiFi)محدَّث ١ سبتمبر ٢٠٢٦
- Mobile Local LLMs 2026: iPhone 16 Pro, iPad M4 & Snapdragon Xمحدَّث ٢٨ أغسطس ٢٠٢٦
- Best Local LLM Apps for Android in 2026: 6 Apps Compared on Real Phonesمحدَّث ٢٤ أغسطس ٢٠٢٦
- Best Mobile LLM Models in 2026: Phi-4 Mini vs Gemma 3 vs SmolLMمحدَّث ١٤ يوليو ٢٠٢٦
مذكور أيضًا في:
- Galaxy vs iPhone On-Device AI: Samsung Galaxy AI vs Apple Intelligence (2026)محدَّث ٢٩ أغسطس ٢٠٢٦
- Run a Local LLM on Your Tablet: iPad Pro M5, Galaxy Tab S10, OnePlus Pad 2 (2026)محدَّث ١٤ يوليو ٢٠٢٦
- Running Local AI on the Galaxy S26: On-Device AI Explained (2026)محدَّث ١٥ يونيو ٢٠٢٦
واجهات VLM السحابية (GPT-4o، Claude، رؤية Gemini)
- الأنسب لـ:
- أعلى قدرة متعددة الوسائط متاحة، دون الحاجة إلى عتاد أو إعداد محلي
- الرخصة:
- احتكارية (API مدفوعة)
الأسئلة الشائعة
ما هو Idefics؟
Idefics عائلة من نماذج الرؤية-اللغة المفتوحة طورها فريق M4 التابع لـ HuggingFace، صُممت صراحةً كنسخة مفتوحة من Flamingo الخاص بـ DeepMind. توجد ثلاثة أجيال: Idefics الأصلي (2023، 9B/80B)، وIdefics2 (أبريل 2024، 8B)، وIdefics3 (أغسطس 2024، 8B).
أي إصدار من Idefics يجب أن أستخدم — Idefics أم Idefics2 أم Idefics3؟
Idefics3 لمعظم المهام اليوم — فهو يملك أقوى تعرف ضوئي وفهم مستندات بين الثلاثة. يظل Idefics2 مناسبًا إذا كنت تحتاج تحديدًا إلى مكدس Apache-2.0 كامل دون شروط مشتقة من Llama. أما Idefics الأصلي فهو متجاوز إلى حد كبير ويحمل قيد ترخيص للأبحاث فقط.
هل Idefics مفتوح المصدر بالكامل ومجاني للاستخدام التجاري؟
يعتمد ذلك على الجيل. Idefics2 خاضع بالكامل لرخصة Apache-2.0. مستودع Idefics3 موسوم بـ Apache-2.0، لكن قاعدته Llama-3.1-8B-Instruct تحمل شروط رخصة Llama 3.1 المجتمعية من Meta، بما في ذلك التزامات فوق 700 مليون مستخدم نشط شهريًا. يحمل Idefics الأصلي قيدًا للأبحاث فقط وغير تجاري من قاعدته LLaMA(1).
كم من VRAM يحتاج Idefics؟
يحتاج Idefics2 (وعلى الأرجح Idefics3، بنفس عدد المعلمات 8B ونفس مُرمّز الرؤية) نحو 18-20 غيغابايت من VRAM في الإعداد القياسي float16 مع flash-attention الموثق في بطاقة نموذج Idefics2، أو 6-7 غيغابايت فقط مع تكميم قوي ومقايضة في الدقة. هذا أثقل بشكل ملحوظ من LLaVA 7B أو MiniCPM-V.
هل يمكنني تشغيل Idefics عبر Ollama؟
ليس حتى وقت هذه المراجعة. لا يُعبّأ Idefics حاليًا في مكتبة نماذج Ollama، ولتحويل GGUF مشكلات توافق مفتوحة تُتابع على مستودع GitHub الخاص بـ Ollama نفسه. يعمل Idefics بدلًا من ذلك عبر Hugging Face Transformers.
هل يستند Idefics إلى Flamingo الخاص بـ DeepMind؟
يُوصف Idefics صراحةً في بطاقة نموذجه الخاصة بأنه "نسخة مفتوحة الوصول من Flamingo، وهو نموذج رؤية-لغة مغلق المصدر طورته DeepMind." وIdefics2 وIdefics3 خلفان بمعمارية مستقلة من الفريق نفسه، M4 التابع لـ HuggingFace.
الخلاصة
Idefics عائلة نماذج رؤية-لغة مفتوحة مفيدة فعليًا، ويصمد Idefics3 تحديدًا جيدًا في أعمال التعرف الضوئي المكثفة على المستندات والاستدلال متعدد الصور حيث تكون بصمته من نحو 18-20 غيغابايت من VRAM في المتناول. غير أنه ليس بديلًا مباشرًا لنماذج الرؤية المحلية الأخف: فهو يحتاج ذاكرة GPU أكثر بشكل ملحوظ من LLaVA 7B أو MiniCPM-V، ولا توجد له تعبئة لـ Ollama أو llama.cpp حتى وقت هذه المراجعة، ووضعه في الترخيص يختلف فعليًا حسب الجيل — فمكدس Apache-2.0 النظيف في Idefics2 اقتراح قانوني مختلف عن التزامات رخصة Llama 3.1 المجتمعية في Idefics3. اختر Idefics3 لفهم المستندات وجودة التعرف الضوئي عندما تتوفر لديك ذاكرة GPU كافية؛ واختر Idefics2 تحديدًا إذا كان مكدس Apache-2.0 الخالص مهمًا؛ واختر LLaVA، عبر مراجعة LLaVA من PromptQuorum، أو أحد النماذج في دليل نماذج رؤية Ollama، لعتاد محلي أخف أو سير عمل قائم على Ollama.
المصادر
- بطاقة نموذج Idefics-80B — بيان نسخة Flamingo، بنية الترخيص، أحجام النماذج.
- بطاقة نموذج Idefics2-8b — النماذج الأساسية، رخصة Apache-2.0، نطاق VRAM الموثق.
- بطاقة نموذج Idefics3-8B-Llama3 — النموذج الأساسي، علامة الترخيص، تفاصيل الإصدار.
- وثائق Transformers الخاصة بـ Idefics3 — مثال الاستخدام، الحد الأدنى لإصدار Transformers.
- رخصة Meta Llama 3.1 المجتمعية — شروط الترخيص التي ترثها القاعدة اللغوية لـ Idefics3.
- طلب GitHub رقم #2183 الخاص بـ Ollama والطلب رقم #3677 — طلبات ميزات مفتوحة تؤكد أن Idefics غير معبأ حاليًا في مكتبة Ollama.
