Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/⁨llama.cpp⁩ مقابل ⁨Ollama⁩ مقابل ⁨vLLM 2026⁩: السرعة والـ ⁨Batching⁩ ومعايير ⁨GPU⁩
Tools & Interfaces

⁨llama.cpp⁩ مقابل ⁨Ollama⁩ مقابل ⁨vLLM 2026⁩: السرعة والـ ⁨Batching⁩ ومعايير ⁨GPU⁩

·9 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

llama.cpp هو الأسرع لكل token على النماذج الصغيرة؛ و Ollama هو الأبسط؛ و vLLM هو الأفضل للإنتاجية والـ batching. اعتبارًا من أبريل 2026، اختر حسب حالة استخدامك: محادثة عادية ← Ollama؛ سرعة لمستخدم واحد ← llama.cpp؛ متعدد المستخدمين/batching ← vLLM.

llama.cpp هو الأسرع لكل token على النماذج الصغيرة؛ و Ollama هو الأبسط؛ و vLLM هو الأفضل للإنتاجية والـ batching. اعتبارًا من أبريل 2026، اختر حسب حالة استخدامك: محادثة عادية ← Ollama؛ سرعة لمستخدم واحد ← llama.cpp؛ متعدد المستخدمين/batching ← vLLM. تشغّل الثلاثة النماذج نفسها وتنتج مخرجات متطابقة — وتختلف فقط في السرعة والإنتاجية.

العرض التقديمي: ⁨llama.cpp⁩ مقابل ⁨Ollama⁩ مقابل ⁨vLLM 2026⁩: السرعة والـ ⁨Batching⁩ ومعايير ⁨GPU⁩

تغطي مجموعة الشرائح التالية: مقارنة السرعة llama.cpp مقابل Ollama مقابل vLLM (RTX 4090, Llama 3 70B Q4 — 36 مقابل 34 مقابل 32 tok/s)، جدول مقارنة الميزات (11 ميزة تشمل التوافق مع OpenAI API والـ batching)، مقارنة إنتاجية الدفعة (طلب فردي مقابل 10 متزامنة: 36 tok/s مقابل 250+ tok/s)، تعقيد التثبيت، التوافق مع API و4 أخطاء شائعة عند اختيار الخلفية. حمّل ملف PDF كبطاقة مرجعية لاختيار خلفية LLM المحلية.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

Key Takeaways

  • llama.cpp: أدنى زمن استجابة لكل token (أقل ms/token). مثالي للمحادثة التفاعلية. اعتماديات قليلة.
  • Ollama: الأسهل استخدامًا. أمر واحد، تنزيل تلقائي للنماذج. المقايضة: إنتاجية أقل بـ 5–10% من llama.cpp.
  • vLLM: أعلى إنتاجية (tokens/ثانية) في الطلبات على دفعات. مثالي لخوادم API الإنتاجية. منحنى تعلّم أكثر حدّة.
  • محادثة لمستخدم واحد: llama.cpp أو Ollama (سرعة متطابقة تقريبًا).
  • API متعدد المستخدمين: vLLM (إنتاجية أعلى بـ 3–5×).
  • استخدام عادي: Ollama (تفوز البساطة).
  • تنتج الثلاثة مخرجات نموذج متطابقة — وتختلف فقط السرعة والإنتاجية.
  • يمكنك تشغيل الثلاثة في آن واحد على الجهاز نفسه (منافذ مختلفة). لا تتعارض.

معايير السرعة — RTX 4090 24 GB

يتصدّر llama.cpp بـ 38 tok/s لكل token فردي؛ ويتفوق vLLM بـ 250+ tok/s في الدفعة. قُيس على RTX 4090 24 GB، Llama 3.3 70B Q4_K_M، طلب فردي، أبريل 2026:

الخلفيةTokens/ثانيةms/tokenVRAM المستخدمةإنتاجية الدفعة
llama.cpp382639 GBN/A (دون batching)
Ollama362839 GBN/A (دفعة واحدة)
vLLM342941 GB250+ tok/s (مستمر)
مقارنة السرعة والإنتاجية: llama.cpp 38 tok/s لكل token فردي (26ms)، Ollama 36 tok/s، vLLM 34 tok/s في طلب فردي، لكن vLLM 250+ tok/s في الدفعة (10 طلبات متزامنة).
مقارنة السرعة والإنتاجية: llama.cpp 38 tok/s لكل token فردي (26ms)، Ollama 36 tok/s، vLLM 34 tok/s في طلب فردي، لكن vLLM 250+ tok/s في الدفعة (10 طلبات متزامنة).

معايير السرعة — RTX 3060 12 GB

قُيس على RTX 3060 12 GB، Llama 3.2 8B Q4_K_M، طلب فردي، أبريل 2026:

الخلفيةTokens/ثانيةms/tokenVRAM المستخدمةإنتاجية الدفعة
llama.cpp52195.2 GBN/A
Ollama48215.4 GBN/A
vLLM45226.1 GB180 tok/s (batch=8)

جدول مقارنة الميزات

llama.cpp: أفضل تكميم وسرعة خام. Ollama: أبسط تثبيت. vLLM: أفضل batching للإنتاج.

الميزةllama.cppOllamavLLM
وقت التثبيت30 دقيقة (ترجمة)5 دقائق (أمر واحد)15 دقيقة (pip install)
API متوافق مع OpenAI✅ (llama-server)✅ (أصلي)✅ (أصلي)
صيغة النموذجGGUFGGUFSafeTensors / HF
دعم GPUCUDA, ROCm, MetalCUDA, ROCm, MetalCUDA فقط
Batching✅ مستمر
متعدد GPU✅ tensor parallel
Apple Silicon✅ Metal✅ Metal
واجهة محادثة❌ (خادم فقط)❌ (يتطلب Open WebUI)❌ (API فقط)
الترخيصMITMITApache 2.0

الـ Batching والإنتاجية

يعالج vLLM 32+ طلبًا على التوازي؛ ويعالج llama.cpp و Ollama طلبًا واحدًا في كل مرة. هنا يتفوق vLLM:

  • llama.cpp: دون batching أصلي. طلب واحد في كل مرة. زمن الاستجابة: 27ms/token. الإنتاجية: 36 tok/s.
  • Ollama: دفعة واحدة فقط. لا يستطيع معالجة 2+ طلب على التوازي. إنتاجية مماثلة لـ llama.cpp.
  • vLLM: batching مستمر أصلي (يدير الطلبات المتزامنة ديناميكيًا). يعالج 32 طلبًا في آن واحد. الإنتاجية: 250+ tok/s على RTX 4090 نفسه.
  • تتضاعف ميزة vLLM مع المستخدمين المتزامنين. ولخوادم API بـ 10+ مستخدمين: vLLM إلزامي.

تعقيد التثبيت

Ollama هو الأبسط (5 دقائق)؛ و vLLM يتطلب Python (15 دقيقة)؛ و llama.cpp يتطلب ترجمة (30 دقيقة). إليك الملخص:

llama.cpp: ترجمة من المصدر أو تنزيل ثنائي. إدارة يدوية لملفات النموذج. 30 دقيقة تثبيت.

Ollama: `brew install ollama` أو تنزيل المثبّت. `ollama run llama3.2`. 5 دقائق تثبيت.

vLLM: `pip install vllm`، ثم `python -m vllm.entrypoints.openai.api_server --model meta-llama/Llama-3.3-8B-Instruct`. 15 دقيقة تثبيت (Python + اعتماديات).

الفائز في البساطة: Ollama.

وقت تثبيت LLM المحلي حسب نظام التشغيل: يستغرق macOS 6 دقائق دون أوامر طرفية؛ ويستغرق Windows 15–20 دقيقة بواجهة رسومية؛ ويتطلب Linux Ubuntu 40–70 دقيقة بما في ذلك تثبيت CUDA.
وقت تثبيت LLM المحلي حسب نظام التشغيل: يستغرق macOS 6 دقائق دون أوامر طرفية؛ ويستغرق Windows 15–20 دقيقة بواجهة رسومية؛ ويتطلب Linux Ubuntu 40–70 دقيقة بما في ذلك تثبيت CUDA.

التوافق مع API

يدعم الثلاثة الآن واجهات API متوافقة مع OpenAI؛ و Ollama و vLLM هما الأبسط.

llama.cpp: API متوافق مع OpenAI (عبر `llama-server`، أُضيف أواخر 2024). يعمل مع إضافات IDE.

Ollama: API متوافق مع OpenAI (عبر `ollama serve` + مكتبة عميل). يعمل مع معظم إضافات IDE.

vLLM: API متوافق مع OpenAI (نقطة `/v1/chat/completions` الأصلية). أعلى توافق.

للتكامل مع IDE (VS Code, Cursor): Ollama أو vLLM. تجاوز llama.cpp.

متى تستخدم كلًا منها؟

llama.cpp: اعتماديات قليلة وسرعة خام. استخدمه إذا كنت تبني محرك استدلال مخصصًا. مثالي لـ Mac (تسريع Metal).

Ollama: بساطة الكل في واحد. استخدمه لواجهة المحادثة والاستخدام الشخصي. يعمل على Mac و Linux و Windows.

vLLM: خادم API إنتاجي. استخدمه لعمليات النشر متعددة المستخدمين ومتطلبات الإنتاجية العالية. يتطلب NVIDIA CUDA — لا يعمل على Apple Silicon (M1/M2/M3/M4).

مصفوفة اختيار الخلفية: Ollama مثالي للمحادثة الشخصية (مستخدم واحد). llama.cpp للاستدلال المخصص. vLLM الخيار الوحيد لـ API الإنتاجي بـ 10+ مستخدمين متزامنين. تنتج الثلاثة مخرجات نموذج متطابقة.
مصفوفة اختيار الخلفية: Ollama مثالي للمحادثة الشخصية (مستخدم واحد). llama.cpp للاستدلال المخصص. vLLM الخيار الوحيد لـ API الإنتاجي بـ 10+ مستخدمين متزامنين. تنتج الثلاثة مخرجات نموذج متطابقة.

أخطاء شائعة عند اختيار خلفية استدلال

  • خطأ: افتراض أن llama.cpp هو الأسرع دائمًا. هذا صحيح فقط لزمن الاستجابة لكل token فردي. يفوز vLLM في الإنتاجية للطلبات على دفعات (أسرع بـ 7× مع 10+ مستخدمين متزامنين).
  • خطأ: استبعاد Ollama لأنه بطيء. Ollama أبطأ بـ 5–10% فقط من llama.cpp الخالص — فرق غير مؤثر للمحادثة التفاعلية حيث تبدو 34 tok/s فورية.
  • خطأ: الاعتقاد بأن عليك اختيار خلفية واحدة. يمكنك تشغيل الثلاثة في آن واحد على منافذ مختلفة. استخدم Ollama للمحادثة الشخصية و vLLM لخادم API لديك.
  • خطأ: استخدام vLLM لمحادثة مستخدم واحد. ميزة vLLM هي الـ batching. وللمحادثة التفاعلية لمستخدم واحد، يفوز إعداد Ollama الأبسط.

السياق الإقليمي وإقامة البيانات

الاتحاد الأوروبي/GDPR: تعمل الخلفيات الثلاث بالكامل داخل المقر. لا بيانات تغادر بنيتك التحتية، ما يستوفي المادة 28 من GDPR (لا حاجة لاتفاقية معالجة بيانات). موصى به للأحمال المالية والصحية والقانونية في الاتحاد الأوروبي.

دول الخليج (PDPL السعودي / قانون حماية البيانات الإماراتي): يُبقي الاستدلال المحلي البيانات داخل بنيتك التحتية، ممتثلًا لأنظمة خصوصية البيانات المحلية مثل نظام حماية البيانات الشخصية السعودي وقانون حماية البيانات الاتحادي الإماراتي ومتطلبات سيادة البيانات الخليجية، ويتيح اعتماد نماذج عربية سيادية (Jais, ALLaM, Falcon) محليًا.

الصين (قانون أمن البيانات): يلبّي الاستدلال داخل المقر متطلبات تسجيل CAC ويُبقي البيانات داخل البلد. و llama.cpp و Ollama الخيارات المفضّلة للشركات الصغيرة والمتوسطة.

الأسئلة الشائعة

أيها يجب أن أستخدم كمبتدئ؟

Ollama. أمر واحد، تنزيل تلقائي للنماذج، واجهة بسيطة.

أيها الأسرع؟

لطلب فردي: llama.cpp (~3% أسرع من Ollama). ولـ 10 طلبات متزامنة: vLLM (~7× أسرع).

هل يمكنني استخدام llama.cpp بدلًا من Ollama؟

نعم، لكنه يتطلب إعدادًا أكثر. تحسين السرعة غير مؤثر (3–5%) لمعظم المستخدمين.

هل vLLM جاهز للإنتاج؟

نعم. يُستخدم في عمليات نشر حقيقية. منحنى تعلّم أكثر حدّة، لكنه يستحق ذلك للإنتاجية العالية.

هل يمكنني تغيير الخلفية دون إعادة تدريب؟

يستخدم llama.cpp و Ollama صيغة GGUF (قابلان للتبديل مباشرةً). ويستخدم vLLM صيغة SafeTensors ويتطلب تحويل النموذج.

أي خلفية أكثر استقرارًا؟

Ollama (بسيط، أخطاء أقل). و llama.cpp مستقر أيضًا. ويُحدَّث vLLM كثيرًا (ميزات أكثر، تغييرات معطِّلة عرضية).

هل يعمل vLLM على Mac؟

لا. يتطلب vLLM NVIDIA CUDA. لـ Mac، استخدم llama.cpp أو Ollama مع تسريع Metal.

قراءات ذات صلة

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs