llama-bench: أفضل أداة لقياس سرعة نماذج LLM المحلية

تحتوي هذه الصفحة على روابط مرجعية لمنتجات طرف ثالث. لا يشارك PromptQuorum في أي برنامج تابع — هذه روابط عادية لا تدر أي عمولة. النقر على الروابط والخطوات التالية تقع على عاتقك بالكامل. لا تمثل هذه الروابط أي تأييد أو تحقق من قِبَل PromptQuorum.
إجابة سريعة
أداة llama-bench، المرفقة مع llama.cpp، هي أفضل أداة لقياس سرعة نموذج LLM محلي — تفصل سرعة معالجة الـ prompt عن سرعة التوليد ضمن طول سياق ومستوى quantization ثابتين. لإجراء فحص سريع لإعدادك الحالي، استخدم بدلًا من ذلك مخرجات `--verbose` في Ollama.
- ▸أفضل أداة قياس أداء بشكل عام: llama-bench — تفصل سرعة معالجة الـ prompt عن سرعة التوليد، وتتحكم في طول السياق ومستوى الـ quantization.
- ▸أسرع فحص: Ollama --verbose — رقم تقريبي لعدد tokens في الثانية من رد محادثة عادي، دون الحاجة إلى أداة قياس منفصلة.
- ▸أفضل خيار واجهة رسومية: LM Studio — قراءة مباشرة لعدد tokens في الثانية أثناء اختبار ومقارنة النماذج، دون سطر أوامر.
- ▸الأفضل لمقارنات الأجهزة: llama-bench — الخيار الوحيد هنا المصمم لتشغيلات متحكم بها وقابلة للتكرار جنبًا إلى جنب.
النقاط الرئيسية
- ✓llama-bench هي أفضل أداة قياس أداء بشكل عام — تفصل سرعة معالجة الـ prompt عن سرعة التوليد ضمن إعدادات ثابتة وقابلة للتكرار
- ✓خيار --verbose في Ollama هو أسرع فحص لمعرفة ما إذا كان إعدادك سريعًا بما يكفي، وليس بديلًا عن مقارنة أجهزة متحكم بها
- ✓LM Studio هو أفضل خيار واجهة رسومية للاختبارات السريعة وتجربة النماذج ومشاهدة الأداء المباشر دون سطر أوامر
- ✓حافظ على ثبات النموذج ومستوى الـ quantization وطول السياق بين التشغيلات — مقارنة إعدادات مختلفة تُنتج رقمًا بلا معنى
- ✓شغّل عدة تكرارات واحسب متوسط النتيجة، ولا تثق أبدًا برقم tokens/sec مُوجَد على الإنترنت دون الإعدادات المرافقة له
الخيار الأفضل: llama-bench
llama-bench هو الخيار الافتراضي الصحيح لكل من يحتاج إلى رقم سرعة قابل للتكرار ويمكن مقارنته بين الأجهزة. هو جزء من llama.cpp، ويعمل من سطر الأوامر، ويُبلغ عن رقمين منفصلين لكل اختبار: سرعة معالجة الـ prompt (مدى سرعة قراءة النموذج للمُدخل) وسرعة التوليد (مدى سرعة إنتاجه لـ tokens جديدة). يتصرف هذان الرقمان بشكل مختلف تمامًا تحت الحمل، لذا فإن أي أداة تدمجهما في رقم واحد تُخفي نصف الصورة.
استخدم llama-bench عند مقارنة بطاقتي GPU قبل الشراء، أو اختبار جهاز Mac أو PC جديد، أو مقارنة مستويات الـ quantization، أو نشر النتائج علنًا، أو تحديد ما إذا كانت ترقية الأجهزة تستحق التكلفة. يُكرر كل اختبار تلقائيًا ويُبلغ عن المتوسط، لذا لست بحاجة لتشغيله خمس مرات يدويًا.
السؤال الأكثر شيوعًا الذي يليها هو ما الذي تتحكم فيه فعليًا خيارات طول السياق وطول الـ prompt/التوليد. باختصار: تتيح لك llama-bench تثبيت طول الـ prompt الاختباري وعدد الـ tokens التي يولّدها، بشكل مستقل عن بعضهما، بحيث يمكنك اختبار تبادل قصير شبيه بالمحادثة أو prompt طويل شبيه بالمستند دون تغيير أي شيء آخر في التشغيل — هذا الفصل هو ما يجعل نتيجتين قابلتين للمقارنة أصلًا.
llama-bench ليست منتجًا تجاريًا — إنها جزء مجاني ومفتوح المصدر من مشروع llama.cpp على GitHub، وتأتي تلقائيًا مع بناء أو تثبيت llama.cpp.
اختبار سريع: Ollama --verbose
خيار `--verbose` في Ollama هو أسرع طريقة للتحقق مما إذا كان إعدادك الحالي يبدو سريعًا بما يكفي — وليس بديلًا عن llama-bench. تشغيل ollama run <model> --verbose يطبع رقم tokens في الثانية في نهاية استجابة محادثة عادية، دون الحاجة إلى خطوة قياس أداء منفصلة.
يأتي الرقم من عملية توليد واحدة غير متحكم بها، وليس من تشغيل متكرر بسياق ثابت، لذا فهو أكثر تشويشًا وغير مناسب لمقارنة قطعتي عتاد مختلفتين. استخدمه للإجابة على سؤال "هل هذا صالح للمحادثة الآن"، واستخدم llama-bench عندما تحتاج الإجابة إلى أن تصمد أمام مقارنة بجهاز آخر.
Ollama مجانية ومفتوحة المصدر — راجع موقع Ollama للحصول على تعليمات التثبيت.
أفضل خيار واجهة رسومية: LM Studio
LM Studio هو الخيار الأفضل إذا أردت قراءة مباشرة لعدد tokens في الثانية دون فتح طرفية (terminal). تعرض واجهة المحادثة فيه سرعة التوليد في الوقت الفعلي، وهو أمر مريح للفحوصات السريعة للأجهزة، وتجربة النماذج، ومقارنة مستويات الـ quantization جنبًا إلى جنب أثناء العمل.
مثل خيار `--verbose` في Ollama، القراءة المباشرة في LM Studio مريحة وليست صارمة — فهي لا تكشف عناصر التحكم في عدد التشغيلات أو طول السياق التي تجعل نتيجة llama-bench موثوقة لقرار شراء عتاد. يوفر LM Studio مستوى مجانيًا؛ التنزيلات على موقع LM Studio.
قِس الأداء قبل الشراء
السؤال الحقيقي وراء معظم عمليات البحث عن قياس الأداء ليس "أي أداة يجب أن أستخدم"، بل "أي عتاد يجب أن أشتري". رقم tokens/sec عام من منشور شخص غريب لا يجيب عن ذلك — شغّل نفس النموذج ومستوى الـ quantization وطول السياق على بطاقتي GPU اللتين تفكر فيهما فعليًا قبل اتخاذ القرار.
بمجرد حصولك على أرقام حقيقية من تشغيلات llama-bench الخاصة بك، قارنها بالخيارات في دليلنا أفضل بطاقات GPU لنماذج LLM المحلية إذا كنت ستبقى على جهاز مكتبي، أو دليلنا أفضل أجهزة Mini PC لنماذج LLM المحلية لجهاز مدمج يعمل باستمرار، أو دليلنا مقارنة Apple Silicon مقابل GPU من NVIDIA إذا كنت تفضل الذاكرة الموحدة بدلًا من بطاقة GPU منفصلة.
ما الذي يجعل القياس مفيدًا
المقارنة المفيدة تُبقي النموذج ومستوى الـ quantization وطول السياق ومحتوى الـ prompt ثابتين بين التشغيلات، وتُبلغ عن سرعة معالجة الـ prompt وسرعة التوليد بشكل منفصل. بدون هذه الضوابط، فإن رقم tokens/sec واحد لا يخبرك بشيء يُذكر عن كيفية أداء الإعداد نفسه مع prompt أطول أو quantization مختلف.
شغّل عدة تكرارات واحسب متوسط النتيجة — التشغيل الواحد يتأثر بالتقييد الحراري (thermal throttling) والعمليات في الخلفية والتحميل البارد للنموذج. تعامل مع رقم tokens/sec غير المنسوب من منتدى أو منشور على وسائل التواصل الاجتماعي على أنه انطباع تقريبي، وليس قياس أداء موثوقًا، ما لم يُذكر النموذج ومستوى الـ quantization وطول السياق معه.
الخلاصة
لقياس أداء جاد وقابل للمقارنة بين الأجهزة، استخدم llama-bench. لفحص سريع لإعدادك الحالي، استخدم مخرجات `--verbose` في Ollama. لأسهل تجربة واجهة رسومية مع عرض مباشر للأداء، استخدم LM Studio. وإذا كان الهدف الحقيقي هو تحديد ما ستشتريه، فقِس أداء النموذج ومستوى الـ quantization اللذين يهمانك بالضبط على كلا الجهازين قبل أن تلتزم — ثم قارن الفائز بأدلتنا حول بطاقات GPU أو أجهزة Mini PC أو أجهزة Mac.
الأسئلة الشائعة
ماذا تتحكم خيارات حجم السياق والـ prompt/التوليد في llama-bench؟▾
لماذا تتفاوت نتائج قياس الأداء بين التشغيلات؟▾
هل سرعة معالجة الـ prompt أم سرعة التوليد أكثر أهمية؟▾
هل يمكنني مقارنة رقم tokens/sec الذي أجده عبر الإنترنت بعتادي الخاص؟▾
لقطات سريعة ذات صلة
- ▸كم VRAM تحتاج للنماذج اللغوية المحلية؟
- ▸أفضل تكميم لـ6 GB VRAM: أي مستوى يتسع؟
- ▸GGUF مقابل GPTQ مقابل AWQ: أي تنسيق تكميم يجب أن تستخدمه؟
- ▸أفضل معالج رسومات من حيث القيمة للنماذج اللغوية الكبيرة المحلية بأسعار الإمارات/الخليج لعام 2026
- ▸ما هو فك التشفير التخميني؟
- ▸SGLang أم vLLM لخدمة النماذج محليًا؟