Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/مراجعة LLaVA (2026): النموذج البحثي الذي أطلق الذكاء الاصطناعي البصري المحلي
Voice, Speech & Multimodal

مراجعة LLaVA (2026): النموذج البحثي الذي أطلق الذكاء الاصطناعي البصري المحلي

·13 دقيقة قراءة·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

LLaVA (Large Language and Vision Assistant) هو نموذج رؤية-لغة مفتوح المصدر يجمع بين مشفِّر بصري ونموذج لغوي كبير مولِّد للنص للإجابة عن أسئلة حول الصور. طوّره باحثون من جامعة ويسكونسن-ماديسون ومايكروسوفت ريسيرش وجامعة كولومبيا، ويُوزَّع على GitHub، ويُشغَّل اليوم بشكل أكثر شيوعًا عبر Ollama (ollama run llava). شيفرته مرخّصة بموجب Apache-2.0، لكن الأوزان المُدرَّبة مسبقًا تعتمد على رخصة النموذج اللغوي الأساسي الذي جرى ضبطها الدقيق انطلاقًا منه (Vicuna، الذي يحمل بدوره رخصة Llama 2 المجتمعية) — فارق دقيق يستحق الفهم قبل الاستخدام التجاري. لمقارنة أوسع لنماذج الرؤية المحلية الحالية، راجع دليل نماذج الرؤية المحلية من PromptQuorum.

LLaVA (Large Language and Vision Assistant) هو نموذج الرؤية-اللغة مفتوح المصدر الذي أرسى الطريقة التي يُبنى بها معظم الذكاء الاصطناعي المتعدد الوسائط محليًا اليوم: مشفِّر بصري يغذي نموذجًا لغويًا كبيرًا مولِّدًا للنص. طوّره باحثون من جامعة ويسكونسن-ماديسون ومايكروسوفت ريسيرش وجامعة كولومبيا، ويُوزَّع على GitHub وعبر مكتبة Ollama، ويمكن الآن تشغيله بأمر واحد (ollama run llava). تتناول هذه المراجعة ما هو LLaVA فعليًا، وأوامر تثبيت واستخدام حقيقية، ورخصته ذات الطبقتين (كود بموجب Apache-2.0 بالإضافة إلى رخص أوزان تعتمد على النموذج الأساسي)، وموقعه اليوم مقارنة بنماذج الرؤية المحلية الأحدث — الصورة الصادقة لعام 2026.

مراجعة LLaVA (2026): النموذج البحثي الذي أطلق الذكاء الاصطناعي البصري المحلي

النقاط الرئيسية

  • نموذج رؤية-لغة يجمع بين مشفِّر بصري CLIP ومفكك ترميز نصي Vicuna (قائم على Llama 2).
  • رخصة الشيفرة: Apache-2.0. الأوزان المُدرَّبة مسبقًا ترث رخصة Llama 2 المجتمعية عبر أساسها Vicuna.
  • يعمل عبر ollama pull llava بثلاثة أحجام: 7B و13B و34B.
  • لا التزامات في مستودع GitHub الرسمي منذ 11 مايو 2024؛ أكثر من 25,000 نجمة، غير مؤرشف.
  • أرسى نمط البنية المعمارية الذي تستخدمه معظم نماذج الرؤية-اللغة المحلية اللاحقة.
  • تتفوق عليه النماذج الأحدث (Qwen2.5-VL وLlama 3.2 Vision وMiniCPM-V) الآن على استخراج النصوص والمخططات والمستندات متعددة اللغات.

📍 في جملة واحدة

LLaVA هو نموذج الرؤية-اللغة مفتوح المصدر من جامعة ويسكونسن-ماديسون ومايكروسوفت ريسيرش وجامعة كولومبيا الذي أرسى بنية مشفِّر بصري بالإضافة إلى نموذج لغوي كبير التي لا يزال يستخدمها معظم الذكاء الاصطناعي المتعدد الوسائط المحلي، مرخّص بموجب Apache-2.0 للشيفرة مع شروط ترخيص مشتقة من Llama 2 للأوزان المُدرَّبة مسبقًا، ويمكن تشغيله الآن بأمر واحد عبر Ollama.

💬 بعبارات بسيطة

إنه نموذج ذكاء اصطناعي مجاني يستطيع النظر إلى صورة والإجابة عن أسئلة حولها — المشروع البحثي الذي أثبت أن هذا يمكن أن يعمل بشكل جيد وبتكلفة زهيدة، ويمكن تشغيله اليوم بأبسط طريقة بكتابة ollama run llava والإشارة إلى ملف صورة.

📌ملاحظة: تنص صفحة مشروع LLaVA الأصلية على أن بياناته وشيفرته ونقطة التحقق منه "مخصصة ومرخّصة للاستخدام البحثي فقط"، وهو تصريح أقدم وأكثر صرامة من رخصة Apache-2.0 التي طُبِّقت لاحقًا على شيفرة مستودع GitHub. اقرأ ملف LICENSE على GitHub وصفحة المشروع كلاهما قبل الاستخدام التجاري — انظر قسم الترخيص والتكلفة أدناه.

التاريخ: من ورقة بحثية إلى معيار للذكاء الاصطناعي المحلي

طوّر LLaVA كل من Haotian Liu وChunyuan Li وQingyang Wu وYong Jae Lee، وهم باحثون منتسبون إلى جامعة ويسكونسن-ماديسون ومايكروسوفت ريسيرش وجامعة كولومبيا، وقُدِّم في ورقة عام 2023 بعنوان "Visual Instruction Tuning"، التي قُبِلت كعرض شفهي في NeurIPS 2023.

كانت الفكرة الأساسية للورقة هي توليد بيانات تدريب متعددة الوسائط لاتباع التعليمات باستخدام GPT-4، ثم استخدام هذه البيانات لتعليم مشفِّر بصري ونموذج لغوي مفتوحَي المصدر اتباع التعليمات البصرية — وصف الصور والإجابة عن أسئلة حولها والاستدلال حول المحتوى البصري بصيغة حوارية، بجزء بسيط من تكلفة تدريب بناء نموذج متعدد الوسائط مملوك من الصفر.

حقق LLaVA-1.5، الذي صدر في أكتوبر 2023، نتائج متطورة على 11 معيارًا قياسيًا بمجرد تعديلات بسيطة على البنية الأصلية — بشكل أساسي موصل رؤية-لغة أعلى قدرة وبيانات تدريب موجهة نحو المهام الأكاديمية — أثناء التدريب في نحو يوم واحد على 8 وحدات معالجة رسومية A100، وفقًا لصفحة المشروع نفسها.

أضاف LLaVA-NeXT (المعروف أيضًا باسم LLaVA-1.6)، الذي صدر في يناير 2024، دعمًا لإدخال صور بدقة أعلى عبر التصحيح الديناميكي (حتى 672×672، أو 336×1344 للصور العريضة/الطويلة)، إلى جانب تحسين استخراج النصوص والاستدلال البصري، ودعم نماذج لغوية أساسية إضافية تتجاوز Vicuna.

**تجمَّع لمستودع haotian-liu/LLaVA العام على GitHub أكثر من 25,000 نجمة**، وهو غير مؤرشف — لكن PromptQuorum لم تجد أي التزامات على فرعه الرئيسي منذ 11 مايو 2024، استنادًا إلى سجل الالتزامات العام للمشروع نفسه. يتوافق هذا مع إصدار بحثي جامعي حقق هدفه (إرساء البنية وتعميمها) بدلًا من منتج تجاري قيد التطوير المستمر.

من طوّر LLaVA؟

طوّر LLaVA كل من Haotian Liu وChunyuan Li وQingyang Wu وYong Jae Lee، وهم باحثون منتسبون إلى جامعة ويسكونسن-ماديسون ومايكروسوفت ريسيرش وجامعة كولومبيا، وقُدِّم في ورقة عام 2023 بعنوان "Visual Instruction Tuning"، وهي عرض شفهي في NeurIPS 2023.

ما الذي يفعله LLaVA فعليًا

يربط LLaVA مشفِّرًا بصريًا بنموذج لغوي كبير بحيث يمكن للنظام المدمج قبول صورة وموجِّه نصي معًا، ثم توليد استجابة بلغة طبيعية حول الصورة — الإجابة عن الأسئلة، ووصف المشاهد، وقراءة النص المرئي، والاستدلال حول المحتوى البصري بصيغة حوارية.

  • مشفِّر CLIP بالإضافة إلى مفكك ترميز نموذج لغوي كبير. يستخدم LLaVA مشفِّرًا بصريًا CLIP ViT-L/14 لتحويل صورة إلى سلسلة من السمات البصرية، ويُسقِط هذه السمات في نفس فضاء تضمين رموز نص النموذج اللغوي عبر وحدة موصل، ويغذي التسلسل المدمج إلى نموذج Vicuna (قائم على Llama 2) أو، في الإصدارات اللاحقة، Mistral أو نموذج لغوي أساسي آخر لتوليد استجابة.
  • الضبط الدقيق بالتعليمات البصرية. بدلًا من التدريب على أزواج صورة-تعليق خام، خضع LLaVA لضبط دقيق على مجموعة بيانات LLaVA-Instruct-150K، وهي محادثات بصرية متعددة الأدوار وُلِّدت عبر توجيه GPT-4 بتعليقات الصور وتوصيفات الكشف عن الأشياء — ما يعلّم النموذج اتباع تعليمات بصرية مفتوحة بدلًا من مجرد توليد التعليقات.
  • ثلاثة أحجام للنموذج عبر Ollama. تُعبِّئ مكتبة Ollama LLaVA بأحجام 7B (4.7 جيجابايت) و13B (8.0 جيجابايت) و34B (20 جيجابايت) — تنتج النماذج الأكبر عمومًا أوصافًا أكثر تفصيلًا ودقة، على حساب المزيد من ذاكرة VRAM واستدلال أبطأ.
  • تحسينات الدقة في LLaVA-1.6 (LLaVA-NeXT). تتعامل النسخة الحالية المدعومة عبر Ollama والمستودع الرسمي مع دقات إدخال أعلى عبر التصحيح الديناميكي، ما يحسّن بشكل ملحوظ مهام قراءة النصوص والتفاصيل الدقيقة مقارنة بالإصدار الأصلي لعام 2023.
  • تدريب يتمحور حول الإنجليزية. إن LLaVA-Instruct-150K والمعايير القياسية الأساسية التي جرى تقييمه عليها هي بمعظمها باللغة الإنجليزية، لذا فإن الأداء على النصوص غير الإنجليزية داخل الصور أضعف جاهزيًا مقارنة بالنماذج المدرَّبة خصيصًا على بيانات مستندات متعددة اللغات.

تثبيت وتشغيل LLaVA: خطوة بخطوة

يغطي هذا الدليل أسرع طريق وأكثرها شيوعًا (Ollama) ويشير إلى طريق المستودع الأصلي نفسه للرجوع إليه.

  1. 1
    تثبيت Ollama.
    Why it matters: نزّل وثبّت [Ollama](https://ollama.com) لأنظمة macOS وLinux وWindows. هذه هي الطريقة المدرَجة رسميًا لتشغيل LLaVA وفقًا [لصفحته في مكتبة Ollama](https://ollama.com/library/llava)، وتستغرق أقل من دقيقتين.
  2. 2
    تنزيل حجم نموذج LLaVA.
    Why it matters: شغّل `ollama pull llava` للنموذج الافتراضي 7B (~4.7 جيجابايت)، أو `ollama pull llava:13b` (~8.0 جيجابايت) أو `ollama pull llava:34b` (~20 جيجابايت) لجودة أعلى على حساب المزيد من ذاكرة VRAM ومساحة القرص.
  3. 3
    تشغيله بصورة من واجهة سطر الأوامر.
    Why it matters: شغّل `ollama run llava "describe this image: ./photo.jpg"`، مع الإشارة مباشرة إلى مسار ملف صورة محلي في نص الموجِّه — لا حاجة إلى علامة منفصلة.
  4. 4
    (بديل) استخدام المستودع الأصلي للتحكم على مستوى البحث.
    Why it matters: استنسخ [haotian-liu/LLaVA](https://github.com/haotian-liu/LLaVA)، وثبّت ملف `requirements.txt` الخاص به، ونزّل نقطة تحقق من Hugging Face للوصول الكامل إلى سكريبتات التدريب وأدوات التقييم وعرض Gradio التوضيحي على الويب — مفيد للبحث أو الضبط الدقيق، لكنه يمثل عتبة تثبيت أعلى بكثير من Ollama.
  5. 5
    (اختياري) استدعاؤه برمجيًا عبر واجهة برمجة تطبيقات Ollama.
    Why it matters: أرسل طلب POST إلى `http://localhost:11434/api/generate` مع الصورة كسلسلة مُرمَّزة بترميز base64 ضمن مصفوفة `images`، أو استخدم مكتبة `ollama` الرسمية للغة Python أو JavaScript — انظر مثال الشيفرة أدناه.

أمثلة استخدام حقيقية

تستخدم هذه الأمثلة صيغة واجهة سطر الأوامر الموثَّقة في Ollama وواجهة برمجة تطبيقات HTTP الخاصة به — الطريقة الأساسية المدعومة لتشغيل LLaVA اليوم.

  • تكفي الإشارة إلى مسار ملف في موجِّه واجهة سطر الأوامر — يكتشف Ollama مسار .jpg/.png ويرفق الصورة تلقائيًا؛ لا توجد علامة --image منفصلة.
  • تكلف أحجام النماذج الأكبر المزيد من ذاكرة VRAM والوقت. نموذج 7B هو الخيار الأسرع والأقل استهلاكًا لذاكرة VRAM؛ استخدم 13B أو 34B عندما تكون دقة الوصف أهم من السرعة.
bash
# التثبيت وتنزيل النموذج
# (نزّل Ollama أولًا من https://ollama.com)
ollama pull llava

# واجهة سطر الأوامر: وصف صورة بالإشارة إلى مسار ملفها في الموجِّه
ollama run llava "describe this image: ./photo.jpg"

# --- واجهة برمجة تطبيقات HTTP (موثَّقة في docs/api.md الخاص بـ Ollama) ---
# /api/generate بصورة مُرمَّزة بترميز base64
curl http://localhost:11434/api/generate -d '{
  "model": "llava",
  "prompt": "What is in this picture?",
  "stream": false,
  "images": ["<بيانات صورة مُرمَّزة بترميز base64>"]
}'

# /api/chat بصورة مُرمَّزة بترميز base64 (محادثات متعددة الأدوار)
curl http://localhost:11434/api/chat -d '{
  "model": "llava",
  "messages": [
    { "role": "user", "content": "What is in this image?", "images": ["<بيانات صورة مُرمَّزة بترميز base64>"] }
  ]
}'

# --- مثال بلغة Python باستخدام مكتبة ollama الرسمية ---
import ollama

response = ollama.chat(
    model="llava",
    messages=[{
        "role": "user",
        "content": "What is in this image?",
        "images": ["photo.jpg"],
    }],
)
print(response["message"]["content"])

الترخيص والتكلفة

**شيفرة LLaVA، في المستودع الرسمي على GitHub، مرخّصة بموجب Apache-2.0**، وهو ما تأكد من خلال ملف LICENSE في المستودع وبيانات الترخيص الوصفية التي يبلّغ عنها GitHub. رخصة Apache-2.0 متساهلة: يمكنك استخدام الشيفرة وتعديلها وإعادة توزيعها، بما في ذلك تجاريًا، مع الإشارة إلى المصدر ومنح براءة اختراع، وبقيود إضافية طفيفة.

الأوزان المُدرَّبة مسبقًا قصة مختلفة: فهي ترث شروطًا من نموذجها اللغوي الأساسي. الأوزان الرسمية المُصدَرة لـ LLaVA مضبوطة دقيقًا انطلاقًا من Vicuna، وهو روبوت محادثة مضبوط بالتعليمات مبني بدوره على Llama 2 من Meta، وتنص وثائق المشروع نفسه على أن المستخدمين "يجب أن يمتثلوا لجميع الشروط والأحكام" الخاصة بالرخص الأصلية — وتحديدًا شروط ترخيص Llama 2 وVicuna وCLIP، وشروط استخدام OpenAI (لأن GPT-4 استُخدم لتوليد بيانات التدريب). هذا يعني أن الاستخدام المسموح به للأوزان يخضع لشروط رخصة Llama 2 المجتمعية (بما في ذلك قيودها على الاستخدام المقبول واشتراط حصول عمليات النشر التجارية الكبيرة جدًا على رخصة منفصلة من Meta)، وليس فقط لرخصة Apache-2.0.

تضيف صفحة مشروع LLaVA الأصلية (موقع منفصل عن مستودع GitHub) تصريحًا أكثر صرامة وأقدم: فهي تصف "البيانات والشيفرة ونقطة التحقق" بأنها "مخصصة ومرخّصة للاستخدام البحثي فقط"، وتشير بشكل منفصل إلى تصنيف CC BY-NC 4.0 (غير التجاري) لمجموعة بيانات التدريب. هذا يسبق رخصة شيفرة Apache-2.0 المعروضة الآن على GitHub وهو أكثر صرامة منها — وهو مزيج مربك فعليًا من تصريحات المشروع نفسه عبر صفحتين مختلفتين، يستحق الإشارة إليه بدلًا من اختيار التصريح الأكثر ملاءمة.

لا شيء من هذا يُعد استشارة قانونية. قبل شحن LLaVA — أو أي نقطة تحقق مضبوطة دقيقًا مبنية عليه — في منتج تجاري، اقرأ ملف LICENSE على GitHub، والشروط المذكورة في صفحة المشروع، ورخصة Llama 2 المجتمعية، واستشر محاميًا بشأن نموذجك الأساسي المحدد وطريقة نشرك.

ما الرخصة التي يستخدمها LLaVA؟

شيفرة LLaVA على GitHub مرخّصة بموجب Apache-2.0، وهي رخصة متساهلة تسمح بالاستخدام التجاري. غير أن أوزانه المُدرَّبة مسبقًا المُصدَرة رسميًا مضبوطة دقيقًا انطلاقًا من Vicuna (المبني على Llama 2 من Meta)، لذا يخضع استخدامها أيضًا لشروط رخصة Llama 2 المجتمعية. تصف صفحة رئيسية منفصلة للمشروع أيضًا البيانات والشيفرة ونقاط التحقق بأنها مخصصة للاستخدام البحثي فقط، وبيانات التدريب بأنها غير تجارية (CC BY-NC 4.0) — تصريح أقدم وأكثر صرامة من رخصة GitHub. هذا ليس استشارة قانونية؛ اقرأ كل ما سبق بنفسك قبل الاستخدام التجاري لنقطة تحقق محددة.

ما لا يصلح له LLaVA

يظل LLaVA نموذجًا مفيدًا فعليًا وموثَّقًا جيدًا، لكنه لم يعد الخيار الأقوى لكل مهمة رؤية في 2026. إنه الأداة الخاطئة للحالات التالية:

  • المهام النصية فقط. LLaVA نموذج رؤية-لغة؛ لمحادثة نصية بحتة دون إشراك صورة، استخدم نموذجًا لغويًا نصيًا مخصصًا (عبر Ollama أو غيره) — تشغيل نموذج متعدد الوسائط لمحادثة نصية فقط يهدر ذاكرة VRAM التي يشغلها مشفِّره البصري دون أي فائدة.
  • الحاجة إلى أقوى استخراج نصوص أو فهم مستندات محلي متاح. اعتبارًا من 2026، تتفوق عليه النماذج التي صدرت بعد LLaVA-NeXT — MiniCPM-V وQwen2.5-VL وLlama 3.2 Vision — في استخراج نصوص المستندات والجداول والاستخراج المُهيكَل، وفقًا لـمقارنة نماذج الرؤية المحلية من PromptQuorum. صُمِّم مشفِّر LLaVA البصري ودُرِّب قبل وجود هذا الجيل من بيانات التدريب عالية الدقة المركّزة على المستندات.
  • قراءة نصوص غير إنجليزية في الصور. إن LLaVA-Instruct-150K وبيانات التدريب الأساسية للنموذج بمعظمها باللغة الإنجليزية. لاستخراج نصوص مستندات صينية أو يابانية أو كورية أو غيرها من الكتابات غير اللاتينية، سيتفوق عليه بوضوح نموذج مدرَّب خصيصًا على مجموعات بيانات مستندات متعددة اللغات (Qwen2.5-VL).
  • الاستخراج الرقمي الدقيق من المخططات والرسوم البيانية. مثل جميع نماذج الرؤية-اللغة المحلية تقريبًا في 2026، لا يُعتمَد على LLaVA في قراءة قيم دقيقة من مخططات معقدة — تحقق من أي أرقام مستخرجة مقابل البيانات المصدرية بغض النظر عن النموذج المستخدم.
  • افتراض تطوير نشط مستمر. بدون التزامات في المستودع الرسمي منذ 11 مايو 2024، لا تتوقع ميزات جديدة أو إصلاحات أخطاء أو نقاط تحقق أحدث من المشروع الأصلي — لقد حلّت محله فعليًا تحديثات محرك Ollama متعدد الوسائط الخاصة به وعائلات النماذج الأحدث كخيار قيد التطوير النشط.
  • قصة ترخيص واحدة وبسيطة. بما أن الشيفرة (Apache-2.0) والأوزان المُصدَرة رسميًا (Apache-2.0 بالإضافة إلى شروط رخصة Llama 2 المجتمعية الموروثة، بالإضافة إلى تصريح أكثر صرامة للاستخدام البحثي فقط على الصفحة الرئيسية المنفصلة للمشروع) تخضع لثلاثة تصريحات متداخلة غير متطابقة تمامًا، لا يقدّم LLaVA وضوح الترخيص في سطر واحد الذي يقدّمه مشروع مثل Bark (المرخّص بالكامل بموجب MIT، دون شروط إضافية).

بدائل LLaVA

Llama 3.2 Vision (عبر Ollama)

الأنسب لـ:
أفضل جودة عامة للإجابة عن أسئلة الصور محليًا؛ أحجام 11B و90B
الرخصة:
رخصة Llama 3.2 المجتمعية

Qwen2.5-VL (عبر Ollama)

الأنسب لـ:
أقوى استخراج نصوص محلي وفهم مستندات متعدد اللغات
الرخصة:
رخصة Qwen (Apache-2.0 للأحجام الأصغر)

MiniCPM-V (عبر Ollama)

الأنسب لـ:
دقة عالية في استخراج نصوص المستندات بذاكرة VRAM منخفضة (~6 جيجابايت)
الرخصة:
مشتقة من Apache-2.0 (OpenBMB)

Idefics3 (Hugging Face)

الأنسب لـ:
نموذج VLM بحثي مفتوح بمعايير قوية للمستندات/استخراج النصوص، لم يُعبَّأ بعد لـ Ollama
الرخصة:
Apache-2.0 (تطبَّق شروط النموذج الأساسي على نسخة Llama3)

واجهات برمجة تطبيقات VLM السحابية (GPT-4o وClaude وGemini Vision)

الأنسب لـ:
أعلى قدرة متعددة الوسائط متاحة، دون الحاجة إلى عتاد محلي
الرخصة:
مملوكة (واجهة برمجة تطبيقات مدفوعة)

الأسئلة الشائعة

ما هو LLaVA؟

LLaVA (Large Language and Vision Assistant) هو نموذج رؤية-لغة مفتوح المصدر طوّره باحثون من جامعة ويسكونسن-ماديسون ومايكروسوفت ريسيرش وجامعة كولومبيا، يجمع بين مشفِّر بصري ونموذج لغوي كبير للإجابة عن أسئلة حول الصور، وقُدِّم في ورقة عام 2023 بعنوان "Visual Instruction Tuning".

هل يمكنني استخدام LLaVA تجاريًا؟

شيفرة LLaVA على GitHub مرخّصة بموجب Apache-2.0، التي تسمح بالاستخدام التجاري. لكن أوزانه المُدرَّبة مسبقًا المُصدَرة رسميًا مضبوطة دقيقًا انطلاقًا من Vicuna (المبني على Llama 2 من Meta)، لذا يخضع استخدامها أيضًا لشروط رخصة Llama 2 المجتمعية. تصف صفحة رئيسية منفصلة للمشروع أيضًا البيانات والشيفرة ونقاط التحقق بأنها للبحث فقط، وبيانات التدريب بأنها غير تجارية (CC BY-NC 4.0) — تصريح أقدم وأكثر صرامة من رخصة GitHub. هذا ليس استشارة قانونية؛ اقرأ جميع الرخص المعمول بها قبل أي نشر تجاري لنقطة تحقق محددة.

كيف أشغّل LLaVA؟

الطريقة الأكثر شيوعًا هي عبر Ollama: ثبّت Ollama، شغّل ollama pull llava، ثم ollama run llava "describe this image: ./photo.jpg". يوفر المستودع الأصلي أيضًا سكريبتات استدلال خاصة بلغة Python وعرض Gradio توضيحيًا للتحكم على مستوى البحث.

ما الفرق بين LLaVA وLLaVA-1.5 وLLaVA-NeXT (LLaVA-1.6)؟

كان LLaVA (2023) هو البنية الأصلية. حسّن LLaVA-1.5 (أكتوبر 2023) نتائج المعايير القياسية بموصل أعلى قدرة وبيانات تدريب أفضل. أضاف LLaVA-NeXT، المعروف أيضًا باسم LLaVA-1.6 (يناير 2024)، إدخال صور بدقة أعلى عبر التصحيح الديناميكي وحسّن استخراج النصوص والاستدلال البصري. تعكس النسخة الموزَّعة عبر Ollama ومستودع GitHub الحالي تحسينات LLaVA-1.6/NeXT.

هل لا يزال LLaVA يخضع لصيانة نشطة؟

مستودع GitHub الرسمي غير مؤرشف، لكن PromptQuorum لم تجد أي التزامات منذ 11 مايو 2024. تعامل معه كإصدار بحثي مكتمل وليس برمجية قيد التطوير النشط — لقد حلّت محله إلى حد كبير النماذج الأحدث وتحديثات محرك Ollama متعدد الوسائط الخاصة به بالنسبة للمشاريع الجديدة.

كيف يقارن LLaVA بنماذج أحدث مثل Qwen2.5-VL أو Llama 3.2 Vision؟

أرسى LLaVA البنية التي تتبعها أيضًا هذه النماذج الأحدث، لكن اعتبارًا من 2026 تتفوق عليه Qwen2.5-VL وLlama 3.2 Vision في استخراج نصوص المستندات وقراءة المخططات و(تحديدًا بالنسبة لـ Qwen2.5-VL) النصوص غير الإنجليزية، وفقًا لمقارنة نماذج الرؤية المحلية من PromptQuorum. يظل LLaVA ذا أهمية بفضل سهولة تثبيته ومجتمعه الكبير وتغطيته الواسعة بالدروس التعليمية.

هل يدعم Ollama فعليًا تشغيل LLaVA؟

نعم — ollama run llava نموذج مدرَج رسميًا في مكتبة Ollama، متاح بأحجام 7B و13B و34B، وهو إحدى أكثر الطرق شيوعًا لتشغيل LLaVA اليوم، إلى جانب سكريبتات الاستدلال الخاصة بالمستودع الأصلي.

ما العتاد الذي أحتاجه لتشغيل LLaVA؟

يتطلب نموذج 7B نحو 4.7 جيجابايت من مساحة القرص ويمكن تشغيله على وحدة معالجة رسومية بذاكرة VRAM تبلغ 6-8 جيجابايت (أو على وحدة المعالجة المركزية، بشكل أبطأ)؛ تحتاج نماذج 13B و34B إلى ذاكرة VRAM ومساحة قرص أكبر تناسبيًا للحصول على جودة وصف أفضل.

الخلاصة

حصل LLaVA على مكانته في تاريخ الذكاء الاصطناعي المحلي: أثبت أن مشفِّرًا بصريًا متواضعًا متصلًا بنموذج لغوي كبير مفتوح المصدر، مضبوطًا دقيقًا على بيانات تعليمات وُلِّدت بواسطة GPT-4، يمكنه تقديم فهم صور مفيد فعليًا دون ميزانية تدريب مملوكة — ولا يزال نمط مشفِّر بصري بالإضافة إلى نموذج لغوي كبير الذي أرساه أساس معظم النماذج المتعددة الوسائط المحلية اليوم. رخصة شيفرته (Apache-2.0) متساهلة، لكن أوزانه المُصدَرة رسميًا تحمل شروطًا مشتقة من Llama 2 عبر أساسها Vicuna، بالإضافة إلى تصريح أقدم وأكثر صرامة للاستخدام البحثي فقط على الصفحة الرئيسية المنفصلة للمشروع — اقرأ الثلاثة جميعًا قبل أي استخدام تجاري. من حيث القدرة الخام لعام 2026، لم يعد LLaVA نموذج الرؤية المحلي الأقوى: لا التزامات منذ مايو 2024، وتتفوق عليه خيارات أحدث مثل Qwen2.5-VL وLlama 3.2 Vision وMiniCPM-V في استخراج النصوص والمخططات والمستندات متعددة اللغات. إذا كنت تريد أبسط تثبيت وأكبر مجتمع وأكثر الدروس التعليمية المتاحة، يظل ollama run llava نقطة انطلاق جيدة فعليًا. إذا كانت دقة المستندات أو النصوص غير الإنجليزية مهمة، اجمع بين هذه المراجعة ومقارنة نماذج الرؤية المحلية ودليل نماذج رؤية Ollama من PromptQuorum قبل اختيار نموذج.

المصادر

← العودة إلى LLM المحلية المتقدمة