Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/مراجعة Idefics (2026): نماذج الرؤية-اللغة المفتوحة من HuggingFace، بتقييم صريح
Voice, Speech & Multimodal

مراجعة Idefics (2026): نماذج الرؤية-اللغة المفتوحة من HuggingFace، بتقييم صريح

·11 دقيقة قراءة·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

Idefics عائلة من نماذج الرؤية-اللغة المفتوحة من فريق M4 التابع لـ HuggingFace، بُنيت كنسخة مفتوحة صريحة من Flamingo الخاص بـ DeepMind. توجد ثلاثة أجيال: Idefics الأصلي (9B/80B، 2023)، وIdefics2 (8B، أبريل 2024)، وIdefics3 (8B، أغسطس 2024). للاستخدام الفعلي اليوم، يُعد Idefics3 التوصية الحالية لمعظم المهام — فهو يحسّن بشكل كبير التعرف الضوئي على الحروف وفهم المستندات والاستدلال البصري مقارنة بـ Idefics2، الذي كان بدوره "أصغر بعشر مرات" من Idefics الأصلي بأداء مماثل. الترخيص دقيق: قاعدة Mistral-7B-v0.1 في Idefics2 تُبقي المكدس بأكمله تحت رخصة Apache-2.0، بينما تحمل قاعدة Llama-3.1-8B-Instruct في Idefics3، إلى جانب علامة Apache-2.0 على مستودع النموذج نفسه، شروط رخصة Llama 3.1 المجتمعية من Meta. لا يُعبّأ Idefics حاليًا في مكتبة Ollama — ولتحويل GGUF مشكلات توافق مفتوحة حتى وقت هذه المراجعة. للاطلاع على نموذج VLM مفتوح مماثل بدعم أدوات أوسع، راجع مراجعة LLaVA من PromptQuorum.

Idefics هي عائلة من نماذج الرؤية-اللغة المفتوحة طورها فريق M4 التابع لـ HuggingFace، وصُممت صراحة بوصفها نسخة مفتوحة من Flamingo الخاص بـ DeepMind. تضم العائلة ثلاثة أجيال — Idefics الأصلي، وIdefics2، وIdefics3 — وهي غير قابلة للتبديل: تستخدم نماذج لغوية أساسية مختلفة، ورخصًا مختلفة من الناحية العملية، ومتطلبات عتاد مختلفة جدًا. تتناول هذه المراجعة التاريخ الفعلي، والإصدار الذي يجب استخدامه فعليًا اليوم، وأرقام VRAM الصادقة، والحالات التي لا يناسبها Idefics، خصوصًا في الإعدادات المحلية محدودة الموارد. للاطلاع على نموذج رؤية-لغة مفتوح مماثل بقاعدة مستخدمين أكبر، راجع مراجعة LLaVA من PromptQuorum؛ ولتشغيل نماذج الرؤية تحديدًا عبر Ollama (لم يُعبّأ Idefics له حاليًا)، راجع دليل نماذج رؤية Ollama.

مراجعة Idefics (2026): نماذج الرؤية-اللغة المفتوحة من HuggingFace، بتقييم صريح

النقاط الرئيسية

  • توجد ثلاثة أجيال: Idefics (2023)، وIdefics2 (أبريل 2024)، وIdefics3 (أغسطس 2024) — كل منها نموذج مستقل، وليس مجرد ترقية بسيطة.
  • Idefics3 هو التوصية الحالية لمعظم المهام؛ ويحسّن بشكل كبير التعرف الضوئي وفهم المستندات مقارنة بـ Idefics2.
  • الترخيص دقيق عبر الأجيال: يحمل Idefics الأصلي قيدًا للأبحاث فقط؛ وIdefics2 خاضع بالكامل لرخصة Apache-2.0 (قاعدة Mistral-7B)؛ ويحمل Idefics3 شروط رخصة Llama 3.1 المجتمعية إلى جانب علامة Apache-2.0 (قاعدة Llama-3.1-8B-Instruct).
  • VRAM: نحو 18-20 غيغابايت بصيغة float16 لـ Idefics2/3، أو 6-7 غيغابايت مع التكميم القوي — أثقل من LLaVA 7B أو MiniCPM-V.
  • غير معبأ في مكتبة Ollama حتى وقت هذه المراجعة؛ وتتابع طلبات GitHub المفتوحة صعوبات تحويل GGUF.
  • الأنسب لـ: مهام التعرف الضوئي المكثفة على المستندات والاستدلال متعدد الصور مع ذاكرة GPU كافية، وليس الإعدادات المحلية محدودة الموارد أو الفورية.

📍 في جملة واحدة

Idefics هو نسخة HuggingFace M4 المفتوحة من Flamingo الخاص بـ DeepMind، وقد وصل الآن إلى جيله الثالث (Idefics3، 8B، أغسطس 2024)، مع اختلافات ملحوظة في الترخيص ومتطلبات VRAM بين إصداراته الثلاثة، وهو غير معبأ حاليًا في مكتبة نماذج Ollama.

💬 بعبارات بسيطة

Idefics عائلة نماذج ذكاء اصطناعي من HuggingFace يمكنها النظر إلى الصور والإجابة عن أسئلة بشأنها، على غرار LLaVA — توضح هذه المراجعة أي الإصدارات الثلاثة يجب استخدامه فعليًا، وتكلفته من ذاكرة GPU، وأين يقصر.

📌ملاحظة: تحقق PromptQuorum من هذه الحقائق مباشرة من بطاقات نماذج HuggingFace الخاصة بـ idefics-80b وidefics2-8b وIdefics3-8B-Llama3، ومن مكتبة Ollama ومتتبع طلبات GitHub الخاص بها — راجع قسم المصادر للروابط الدقيقة.

التاريخ: HuggingFace M4 ونسخة Flamingo

**تنص بطاقة نموذج Idefics الأصلي صراحةً على أنه "نسخة مفتوحة الوصول من Flamingo، وهو نموذج رؤية-لغة مغلق المصدر طورته DeepMind."** أُصدر من قبل فريق M4 التابع لـ HuggingFace عام 2023 بحجمين، 9B و80B معلمة، يجمع بين مُرمّز رؤية وقاعدة نموذج لغوي LLaMA(1).

يحمل Idefics الأصلي رخصة مختلطة، وليست رخصة تساهلية واحدة. يُطرح مُرمّز الرؤية ومعاملات الربط المُدرّبة حديثًا تحت رخصة MIT، لكن قاعدة النموذج اللغوي LLaMA(1) تتطلب الالتزام برخصة Meta الأصلية الخاصة بالأبحاث فقط وغير التجارية لـ LLaMA. هذا يجعل Idefics الأصلي غير مناسب للاستخدام التجاري في معظم الحالات، بصرف النظر عن علامة MIT على أجزاء من المكدس.

استبدل Idefics2 (8B)، الذي صدر حوالي أبريل 2024، قاعدة LLaMA(1) بـ Mistral-7B-v0.1 وجمعه مع مُرمّز رؤية SigLIP. ولأن كلا النموذجين الأساسيين برخصة Apache-2.0، تنص بطاقة نموذج Idefics2 نفسه على أن النموذج بأكمله برخصة Apache-2.0 — ما يحل مشكلة ترخيص Idefics الأصلي. تنسب HuggingFace نفسها إلى Idefics2 مطابقة أداء Idefics-80B بحجم أصغر بنحو عشر مرات، مع تعرف ضوئي وفهم مستندات أفضل بشكل ملحوظ.

احتفظ Idefics3 (8B)، الذي صدر في 22 أغسطس 2024، بمُرمّز الرؤية SigLIP، لكنه بدّل القاعدة اللغوية إلى Meta-Llama-3.1-8B-Instruct. تُظهر بطاقة نموذجه الخاصة تحسنًا كبيرًا مقارنة بـ Idefics2، خصوصًا في فهم المستندات والتعرف الضوئي والاستدلال البصري. أُضيف إلى Hugging Face Transformers في الإصدار 4.46.

هل Idefics نسخة من Flamingo الخاص بـ DeepMind؟

نعم. تصف بطاقة نموذج Idefics الأصلي صراحةً بأنه "نسخة مفتوحة الوصول من Flamingo، وهو نموذج رؤية-لغة مغلق المصدر طورته DeepMind." وIdefics2 وIdefics3 أجيال لاحقة من HuggingFace M4، بُنيت بمعمارية مستقلة ضمن السلالة نفسها.

Idefics مقابل Idefics2 مقابل Idefics3: ما الذي تغيّر فعليًا

الأجيال الثلاثة نماذج مستقلة بمعماريات أساسية مختلفة — وليست نموذجًا واحدًا بترقيات إصدار تدريجية. إليك ما يختلف فعليًا، تم التحقق منه في بطاقة HuggingFace الخاصة بكل نموذج.

Idefics (9B/80B)

الإصدار (تاريخ):
2023
القاعدة:
LLaMA(1) + مُرمّز رؤية مخصص
ملاحظات:
قيد ترخيص للأبحاث فقط موروث من LLaMA(1)؛ متجاوز إلى حد كبير

Idefics2 (8B)

الإصدار (تاريخ):
أبريل 2024
القاعدة:
Mistral-7B-v0.1 + SigLIP
ملاحظات:
خاضع بالكامل لرخصة Apache-2.0؛ يطابق Idefics-80B بحجم أصغر بعشر مرات

Idefics3 (8B)

الإصدار (تاريخ):
22 أغسطس 2024
القاعدة:
Llama-3.1-8B-Instruct + SigLIP
ملاحظات:
أفضل تعرف ضوئي/فهم مستندات بين الثلاثة؛ تنطبق شروط ترخيص Llama 3.1

لم يجد PromptQuorum أي "Idefics4" مؤكد علنًا حتى وقت هذه المراجعة. Idefics3 هو أحدث جيل والتوصية الحالية لمعظم المهام.

فرق الترخيص: ليس مجرد Apache-2.0

يضع دليل PromptQuorum علامة على ترخيص Idefics بأنه "Apache 2.0" — وهذا صحيح بالنسبة لمستودع النموذج والكود، لكنه غير مكتمل بالنسبة للوضع العملي للترخيص، على غرار كون رخصة كود LLaVA Apache-2.0 لا تمتد تلقائيًا إلى كل نقطة تفتيش نموذج أساسي.

Idefics2 هو الحالة الأوضح: كل من قاعدته اللغوية Mistral-7B-v0.1 ومُرمّز الرؤية SigLIP برخصة Apache-2.0، لذا فإن مكدس النموذج بأكمله فعليًا برخصة Apache-2.0 دون شروط إضافية.

Idefics3 أكثر دقة. مستودعه الخاص على HuggingFace موسوم بـ Apache-2.0، لكن قاعدته اللغوية، Meta-Llama-3.1-8B-Instruct، تُطرح تحت رخصة Llama 3.1 المجتمعية من Meta — التي تتضمن سياسة استخدام مقبول وبندًا يشترط الحصول على رخصة منفصلة من Meta إذا تجاوز منتج تابع 700 مليون مستخدم نشط شهريًا. على من ينشر Idefics3 تجاريًا على نطاق واسع قراءة شروط رخصة Llama 3.1 من Meta مباشرة، وليس فقط علامة Apache-2.0 في مستودع Idefics3.

Idefics الأصلي هو الأكثر تقييدًا. تحمل قاعدته LLaMA(1) رخصة Meta الأصلية الخاصة بالأبحاث فقط وغير التجارية، ما يجعل الاستخدام التجاري للنموذج الكامل 9B/80B غير واضح قانونيًا في أفضل الأحوال وغير متاح في أسوئها — حتى لو كانت أوزان مُرمّز الرؤية والوصل مرخصة بشكل منفصل تحت MIT.

هل Idefics مجاني للاستخدام التجاري؟

يعتمد ذلك على الجيل. Idefics2 خاضع بالكامل لرخصة Apache-2.0 دون قيود إضافية. مستودع Idefics3 نفسه برخصة Apache-2.0، لكن قاعدته Llama-3.1-8B-Instruct تحمل شروط رخصة Llama 3.1 المجتمعية من Meta، بما في ذلك شرط ترخيص منفصل فوق 700 مليون مستخدم نشط شهريًا. يحمل Idefics الأصلي قيدًا للأبحاث فقط وغير تجاري من قاعدته LLaMA(1).

مثال استخدام حقيقي: مكتبة Transformers

يُستخدم Idefics3 عبر صنفي AutoModelForVision2Seq وAutoProcessor من Hugging Face Transformers، الموثقين في وثائق نموذج Idefics3 الخاصة بـ Transformers. يلزم إصدار Transformers 4.46 أو أحدث.

  • لا يوجد اليوم مسار عبر Ollama أو llama.cpp. يعمل Idefics عبر Transformers (أو خوادم استدلال متوافقة مثل Text Generation Inference)، وليس عبر مُشغّلات قائمة على GGUF.
  • تقليل معامل دقة الصورة يمكن أن يخفض استهلاك ذاكرة GPU. توثق بطاقات نماذج Idefics2/3 تقليل عدد أجزاء الصورة الفرعية المعالجة (يُشار إليه بـ N في وثائق Idefics3) كوسيلة لمقايضة بعض الدقة مقابل VRAM أقل.
python
# يتطلب transformers >= 4.46 (وفق وثائق نموذج Idefics3 من Hugging Face)
# pip install transformers pillow torch

from transformers import AutoProcessor, AutoModelForVision2Seq
from PIL import Image
import torch

model_id = "HuggingFaceM4/Idefics3-8B-Llama3"

processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForVision2Seq.from_pretrained(
    model_id,
    torch_dtype=torch.float16,
).to("cuda")

image = Image.open("photo.jpg")

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image"},
            {"type": "text", "text": "What is in this image?"},
        ],
    },
]
prompt = processor.apply_chat_template(messages, add_generation_prompt=True)
inputs = processor(text=prompt, images=[image], return_tensors="pt").to("cuda")

generated_ids = model.generate(**inputs, max_new_tokens=200)
generated_text = processor.batch_decode(generated_ids, skip_special_tokens=True)
print(generated_text[0])

متطلبات VRAM والعتاد

يُعد Idefics2 وIdefics3 أثقل بشكل ملحوظ من نقاط تفتيش LLaVA أو MiniCPM-V بحجم مماثل، ويرجع ذلك إلى حد كبير إلى طريقة معالجتهما لدقة الصورة. تأتي هذه الأرقام مباشرة من بطاقة نموذج Idefics2 نفسه، التي توثق نطاق VRAM الخاص به صراحة؛ ومن المتوقع أن يكون Idefics3 (بنفس عدد المعلمات 8B ونفس مُرمّز الرؤية) مشابهًا، رغم أن PromptQuorum لم يجد جدول VRAM منشورًا بنفس التفصيل خصيصًا لـ Idefics3.

الإعداد
VRAM تقريبي
ملاحظات
float16 + flash-attention~18-20 غيغابايتموثق في بطاقة نموذج Idefics2 كإعداد قياسي
بدون تحسيناتحتى ~55 غيغابايت في الذروةالحد الأعلى في بطاقة نموذج Idefics2 للاستدلال غير المُحسَّن
تكميم قوي~6-7 غيغابايتالحد الأدنى الموثق في بطاقة نموذج Idefics2؛ توقع مقايضة في الدقة
LLaVA 7B (للمقارنة)~6-8 غيغابايتراجع مراجعة LLaVA من PromptQuorum

📌ملاحظة: لم يُجرِ PromptQuorum اختبارات عتاد خاصة به لهذا المقال؛ هذه الأرقام مأخوذة من بطاقة نموذج Idefics2 المنشورة. Idefics فعليًا أثقل من LLaVA 7B أو MiniCPM-V عند مستويات قدرة مماثلة — كن صريحًا مع نفسك بشأن VRAM المتاح قبل اختياره لنشر محدود الموارد.

ما لا يصلح له Idefics

Idefics3 نموذج رؤية-لغة مفتوح قادر، لكنه الخيار الخطأ في الحالات التالية:

  • الإعدادات المحلية محدودة الموارد. باستهلاك نحو 18-20 غيغابايت من VRAM في إعداده القياسي float16، يحتاج Idefics2/3 ذاكرة GPU أكثر بشكل ملحوظ من LLaVA 7B (~6-8 غيغابايت) أو MiniCPM-V (~5.5 غيغابايت). إذا كانت ميزانية العتاد لديك بطاقة رسوميات استهلاكية واحدة بـ 8 غيغابايت من VRAM أو أقل، فإن Idefics ليس خيارًا واقعيًا دون تكميم قوي وقبول مقايضة في الدقة.
  • تطبيقات الوقت الفعلي أو ذات زمن الاستجابة المنخفض. نموذج رؤية-لغة بحجم 8B معلمة يعالج أجزاء صورة فرعية متعددة لكل إدخال لم يُبنَ لأسرع وقت استجابة ممكن. إذا كانت الأولوية للزمن، فسيستجيب نموذج أصغر مثل Moondream (1.8B) بسرعة أكبر، مع قدرة أقل.
  • سير عمل مباشر مع Ollama أو llama.cpp. لا يُعبّأ Idefics حاليًا في مكتبة Ollama، ولتحويل GGUF مشكلات توافق مفتوحة وغير محلولة تُتابع على GitHub الخاص بـ Ollama نفسه. إذا كان سير عملك يعتمد على Ollama تحديدًا، راجع دليل نماذج رؤية Ollama من PromptQuorum للنماذج القابلة للتنزيل فعليًا اليوم.
  • افتراض رخصة واحدة موحدة عبر الإصدارات. التعامل مع "Idefics" كمنتج واحد برخصة واحدة خطأ — تحقق من الجيل الذي تنشره واقرأ شروط الترخيص الخاصة بذلك النموذج تحديدًا، خصوصًا التزامات رخصة Llama 3.1 المجتمعية لـ Idefics3 على نطاق واسع.

البدائل والمنافسون

LLaVA

الأنسب لـ:
دعم أدوات أوسع، بما في ذلك التعبئة لـ Ollama وllama.cpp؛ بصمة VRAM أخف عند 7B
الرخصة:
Apache-2.0 (الكود)؛ ويعتمد على النموذج الأساسي بالنسبة لنقاط التفتيش

نماذج رؤية Ollama

الأنسب لـ:
أبسط إعداد محلي عبر ollama pull/ollama run؛ لا يندرج Idefics ضمنها حتى وقت هذه المراجعة
الرخصة:
تختلف حسب النموذج

MLC Chat

الأنسب لـ:
نشر على الجهاز عبر منصات متعددة؛ مركّز بشكل أساسي على النص حتى وقت هذه المراجعة — تحقق من دعم الرؤية الحالي قبل الاعتماد عليه
الرخصة:
Apache-2.0
مقالات حول MLC Chat (5)

مذكور أيضًا في:

واجهات VLM السحابية (GPT-4o، Claude، رؤية Gemini)

الأنسب لـ:
أعلى قدرة متعددة الوسائط متاحة، دون الحاجة إلى عتاد أو إعداد محلي
الرخصة:
احتكارية (API مدفوعة)

الأسئلة الشائعة

ما هو Idefics؟

Idefics عائلة من نماذج الرؤية-اللغة المفتوحة طورها فريق M4 التابع لـ HuggingFace، صُممت صراحةً كنسخة مفتوحة من Flamingo الخاص بـ DeepMind. توجد ثلاثة أجيال: Idefics الأصلي (2023، 9B/80B)، وIdefics2 (أبريل 2024، 8B)، وIdefics3 (أغسطس 2024، 8B).

أي إصدار من Idefics يجب أن أستخدم — Idefics أم Idefics2 أم Idefics3؟

Idefics3 لمعظم المهام اليوم — فهو يملك أقوى تعرف ضوئي وفهم مستندات بين الثلاثة. يظل Idefics2 مناسبًا إذا كنت تحتاج تحديدًا إلى مكدس Apache-2.0 كامل دون شروط مشتقة من Llama. أما Idefics الأصلي فهو متجاوز إلى حد كبير ويحمل قيد ترخيص للأبحاث فقط.

هل Idefics مفتوح المصدر بالكامل ومجاني للاستخدام التجاري؟

يعتمد ذلك على الجيل. Idefics2 خاضع بالكامل لرخصة Apache-2.0. مستودع Idefics3 موسوم بـ Apache-2.0، لكن قاعدته Llama-3.1-8B-Instruct تحمل شروط رخصة Llama 3.1 المجتمعية من Meta، بما في ذلك التزامات فوق 700 مليون مستخدم نشط شهريًا. يحمل Idefics الأصلي قيدًا للأبحاث فقط وغير تجاري من قاعدته LLaMA(1).

كم من VRAM يحتاج Idefics؟

يحتاج Idefics2 (وعلى الأرجح Idefics3، بنفس عدد المعلمات 8B ونفس مُرمّز الرؤية) نحو 18-20 غيغابايت من VRAM في الإعداد القياسي float16 مع flash-attention الموثق في بطاقة نموذج Idefics2، أو 6-7 غيغابايت فقط مع تكميم قوي ومقايضة في الدقة. هذا أثقل بشكل ملحوظ من LLaVA 7B أو MiniCPM-V.

هل يمكنني تشغيل Idefics عبر Ollama؟

ليس حتى وقت هذه المراجعة. لا يُعبّأ Idefics حاليًا في مكتبة نماذج Ollama، ولتحويل GGUF مشكلات توافق مفتوحة تُتابع على مستودع GitHub الخاص بـ Ollama نفسه. يعمل Idefics بدلًا من ذلك عبر Hugging Face Transformers.

هل يستند Idefics إلى Flamingo الخاص بـ DeepMind؟

يُوصف Idefics صراحةً في بطاقة نموذجه الخاصة بأنه "نسخة مفتوحة الوصول من Flamingo، وهو نموذج رؤية-لغة مغلق المصدر طورته DeepMind." وIdefics2 وIdefics3 خلفان بمعمارية مستقلة من الفريق نفسه، M4 التابع لـ HuggingFace.

الخلاصة

Idefics عائلة نماذج رؤية-لغة مفتوحة مفيدة فعليًا، ويصمد Idefics3 تحديدًا جيدًا في أعمال التعرف الضوئي المكثفة على المستندات والاستدلال متعدد الصور حيث تكون بصمته من نحو 18-20 غيغابايت من VRAM في المتناول. غير أنه ليس بديلًا مباشرًا لنماذج الرؤية المحلية الأخف: فهو يحتاج ذاكرة GPU أكثر بشكل ملحوظ من LLaVA 7B أو MiniCPM-V، ولا توجد له تعبئة لـ Ollama أو llama.cpp حتى وقت هذه المراجعة، ووضعه في الترخيص يختلف فعليًا حسب الجيل — فمكدس Apache-2.0 النظيف في Idefics2 اقتراح قانوني مختلف عن التزامات رخصة Llama 3.1 المجتمعية في Idefics3. اختر Idefics3 لفهم المستندات وجودة التعرف الضوئي عندما تتوفر لديك ذاكرة GPU كافية؛ واختر Idefics2 تحديدًا إذا كان مكدس Apache-2.0 الخالص مهمًا؛ واختر LLaVA، عبر مراجعة LLaVA من PromptQuorum، أو أحد النماذج في دليل نماذج رؤية Ollama، لعتاد محلي أخف أو سير عمل قائم على Ollama.

المصادر

← العودة إلى LLM المحلية المتقدمة