Key Takeaways
- Braintrust — باقة Starter المجانية تشمل 10 آلاف تقييم شهريًا، وجيغابايت واحدًا من البيانات المعالجة، واحتفاظًا لأربعة عشر يومًا، و10 دولارات رصيد نماذج، وعدد مستخدمين غير محدود. وباقة Pro بـ249 دولارًا شهريًا وتشمل 249 دولارًا رصيد نماذج، و5 جيغابايت، و50 ألف تقييم، واحتفاظًا لثلاثين يومًا. وتضيف باقة Enterprise احتفاظًا مخصصًا ونشرًا محليًا أو مستضافًا.
- Weave — جزء من Weights & Biases. تمنح الباقة المجانية مقاعد Weave غير محدودة وجيغابايت واحدًا من الاستيعاب شهريًا. وتبدأ Pro من 60 دولارًا شهريًا مع 1.5 جيغابايت، لكن الأهلية مقصورة صراحةً على «early-stage teams fewer than 50 employees»؛ والمؤسسات الأكبر عليها الانتقال إلى Enterprise. ويكلّف الاستيعاب الإضافي 0.10 دولار لكل ميغابايت.
- Promptfoo — 24.6 ألف نجمة على GitHub، ورخصة MIT، ومجانية عند أي حجم لأنها تعمل بوصفها واجهة سطر أوامر ومكتبة على بنية تحتية تملكها أصلًا. وكلفتك الوحيدة هي إنفاق واجهة النموذج البرمجية الذي تستهلكه التقييمات نفسها، وهو ما يحدث في أي منصة عند استخدام نموذج لغوي كحكم.
- أعلنت OpenAI استحواذها على Promptfoo في 9 مارس 2026 وصرّحت علنًا: «Promptfoo will remain open source under the current license, and we will continue to service and support current customers.» ولا يزال المستودع مرخّصًا بـMIT وقد حُدّث في اليوم الذي جرى فيه التحقق من هذه الصفحة.
- تصويب يستحق الذكر: تصف عدة مقالات رصيد نماذج باقة Pro لدى Braintrust بأنه سعر ترويجي ينخفض إلى 100 دولار شهريًا بعد 1 سبتمبر 2026. ولا يظهر أي تاريخ انتهاء من هذا القبيل على صفحة أسعار Braintrust. والعرض الوحيد المذكور فيها هو «6–12 months free for qualifying startups». ضع ميزانيتك انطلاقًا من صفحة المزوّد.
- Promptfoo أداة أمن بقدر ما هي أداة تقييم. فوصفها الذاتي يبدأ باختبار الفريق الأحمر واختبار الاختراق وفحص الثغرات، وقد وضعت OpenAI الاستحواذ في سياق اختبار أمن الوكلاء. وهذا فارق حقيقي في التركيز عن Braintrust وWeave.
- لا يملك أي من الثلاثة برنامج عمولة أو إحالة علنيًا لصنّاع المحتوى. وتدير Weights & Biases برنامج شركاء، لكنه ترتيب لإعادة البيع والتكامل التقني موجّه إلى بيوت الاستشارات، لا دفعًا مقابل كل إحالة. ومنصة PromptQuorum لا تكسب شيئًا من هذه الصفحة.
🏆 الخيار الأنسب لحالتك
اختر بناءً على مكان تشغيل التقييم ومن يقرأ النتائج، لا بناءً على قائمة وظائف التقييم؛ فالثلاثة تغطي المقومات نفسها. اقرأ القائمة وتوقف عند أول سطر ينطبق عليك.
- يحتاج من لا يكتبون الشيفرة إلى مراجعة حالات الفشل ← Braintrust. فالواجهة المستضافة وطوابير المراجعة البشرية وإدارة إصدارات مجموعات البيانات وُجدت لهذا تحديدًا، والباقة المجانية تغطي معظم الاستخدام في المراحل الأولى.
- تستخدم Weights & Biases بالفعل ← Weave. إذ تظهر التقييمات إلى جانب تتبّع تجاربك القائم، وتمنح الباقة المجانية مقاعد غير محدودة. تحقق من حد الخمسين موظفًا قبل الاعتماد على Pro.
- تريد تقييمات في صورة إعدادات خاضعة لإدارة الإصدارات دون مزوّد ← Promptfoo. ملفات YAML أو JS إلى جانب شيفرتك، قابلة للمقارنة في طلب سحب، ومجانية أيًا كان الحجم.
- تختبر حقن الموجّهات وأمن الوكلاء لا الجودة وحدها ← Promptfoo. فاختبار الفريق الأحمر وفحص الثغرات هما غرضها المعلن؛ راجع أدوات أمن الموجّهات واختبار الحقن.
- لديك حفنة من حالات الاختبار ومهندسة واحدة ← لا شيء منها بعد. يكفي سكربت يمنح درجات ضمن التكامل المستمر إلى أن تكبر مجموعة البيانات بما يستدعي إدارتها.
ما الذي تفعله أداة تقييم النماذج اللغوية فعليًا
تمرّر أداة تقييم النماذج اللغوية مجموعةً من حالات الاختبار عبر موجّهك أو وكيلك وتمنح كل مخرَج درجة، لتعرف قبل أن يصل التغيير إلى المستخدمين ما إذا كان قد حسّن الأمور أم أساءها. ومجموعة البيانات عادةً أزواج من المدخل والمخرَج المتوقع، مأخوذة من سجلات الإنتاج، أو مكتوبة يدويًا بوصفها حالات حدّية، أو مولّدة. وتتدرج المقيّمات من فحوص حتمية مثل مطابقة النصوص والتحقق من مخطط JSON، مرورًا بالتقييم بنموذج لغوي كحكم حيث يمنح نموذج ثانٍ درجةً وفق معيار، وصولًا إلى دوال مخصصة تكتبها بنفسك.
وهذه مهمة مختلفة عن مراقبة ما يفعله النظام بعد إطلاقه. فالتقييم يجيب عن «هل هذا التغيير آمن للإطلاق؟»، بينما تجيب مراقبة الإنتاج عن «ماذا يفعل الآن؟». وهذه الصفحة تخص السؤال الأول. وللنظر إلى المشكلة نفسها على مستوى الموجّه، راجع كيف تقيّم جودة الموجّه.
أداة تقييم النماذج اللغوية تمرّر مجموعة ثابتة من حالات الاختبار عبر موجّهك أو وكيلك، وتمنح كل مخرَج درجة عبر فحوص حتمية أو تقييم بنموذج لغوي كحكم أو دوال مخصصة، ثم تُبلّغ عمّا إذا كان التغيير قد حسّن الجودة أو أضعفها قبل الإطلاق.
إنها حزمة اختبارات لشيء لا يعطي الإجابة نفسها مرتين. فبدل التحقق من مخرَج بعينه، تمنحه درجة وتراقب إن كان المتوسط يتحرك في الاتجاه الخطأ حين تغيّر موجّهًا.
مقارنة بين Braintrust وWeave وPromptfoo
الثلاثة تدعم استخدام نموذج لغوي كحكم ومقيّمات مخصصة واختبارات انحدار قائمة على مجموعات بيانات، لذا تدور المقارنة حول نمط الاستضافة وبنية التكلفة وشروط الأهلية. قُرئت الأسعار من صفحات المزوّدين في 28 أغسطس 2026، وأرقام المستودعات من واجهة GitHub البرمجية في اليوم نفسه.
| المعيار | Braintrust | Weave | Promptfoo |
|---|---|---|---|
| الشكل | منصة مستضافة بواجهة | مستضافة، جزء من W&B | واجهة سطر أوامر ومكتبة تشغّلها بنفسك |
| الرخصة | تجارية | حزمة التطوير Apache-2.0، والخدمة مستضافة | MIT |
| الباقة المجانية | 10 آلاف تقييم شهريًا، 1 غيغابايت، 14 يومًا | استيعاب 1 غيغابايت شهريًا، مقاعد غير محدودة | مجانية بأي حجم |
| مدخل الدفع | Pro بـ249 دولارًا شهريًا مع 249 دولارًا رصيدًا | من 60 دولارًا شهريًا، 1.5 غيغابايت | باقة Enterprise بسعر مخصص |
| حد الأهلية | لا شيء معلن | Pro لمن يقل عددهم عن 50 موظفًا فقط | لا يوجد |
| تجاوز الحصة | 1.50 دولار لكل 1000 تقييم في Pro | 0.10 دولار لكل ميغابايت استيعاب | فقط إنفاق واجهة النموذج البرمجية |
| الاستضافة الذاتية | Enterprise، محليًا أو مستضافًا | Enterprise، مستأجر واحد | الوضع الافتراضي — تعمل على أجهزتك |
| برنامج العمولة | لم يُعثر عليه | لم يُعثر عليه | لم يُعثر عليه |
⚠️Warning: باقة Pro لدى Weave ليست مجرد خطة أرخص: إذ تنص Weights & Biases على أنها «for early-stage teams fewer than 50 employees»، وأن العملاء الذين يتجاوزون هذه الإرشادات عليهم الانتقال إلى Enterprise. فإن تجاوزت هذا العدد، تصبح المقارنة الحقيقية بين Braintrust Pro بـ249 دولارًا وعرض Enterprise مخصص، لا مقابل 60 دولارًا.
Braintrust: خيار الإنتاج
Braintrust هو ما تختاره حين يحتاج من لا يكتبون الشيفرة إلى النظر في نتائج التقييم. فقيمته متركزة في الواجهة المستضافة وإدارة إصدارات مجموعات البيانات وسير المراجعة البشرية، وهو تحديدًا الجزء الذي كنت ستضطر إلى بنائه بنفسك.
Braintrust — الأفضل لفرق الإنتاج متعددة التخصصات
مجانية حتى 10 آلاف تقييم شهريًا، وPro بـ249 دولارًا مع 249 دولارًا رصيدًا
باقة Starter المجانية سخية على نحو غير معتاد بالنسبة إلى منصة مستضافة: 10 آلاف تقييم شهريًا، وجيغابايت واحد من البيانات المعالجة، واحتفاظ لأربعة عشر يومًا، و10 دولارات رصيد نماذج، إضافةً إلى مستخدمين ومشاريع ومجموعات بيانات وتجارب بلا حد. والمقاعد غير المحدودة في باقة مجانية تهم هنا تحديدًا، لأن سبب اختيار Braintrust أصلًا هو تمكين مديري المنتج وخبراء المجال من مراجعة حالات الفشل دون شراء تراخيص لهم. وترفع باقة Pro بـ249 دولارًا شهريًا ذلك إلى 50 ألف تقييم و5 جيغابايت واحتفاظ لثلاثين يومًا، وتشمل 249 دولارًا رصيد نماذج، وهو ما يعوّض إلى حد بعيد إنفاق نموذج الحكم في حِمل متوسط. والتجاوز يُحتسب بدل أن يُحجب: 1.50 دولار لكل 1000 تقييم و3 دولارات لكل جيغابايت في Pro. وتضيف Enterprise احتفاظًا وتصديرًا مخصصين، وتحكمًا بالأدوار، ونشرًا محليًا أو مستضافًا.
الإيجابيات
- +مستخدمون غير محدودين حتى في الباقة المجانية، وهو بيت القصيد
- +الباقة المجانية بعشرة آلاف تقييم شهريًا تغطي فعلًا المشاريع في مراحلها الأولى
- +تشمل Pro رصيد نماذج بـ249 دولارًا، ما يعوّض معظم إنفاق نموذج الحكم
- +يتوفر نشر محلي أو مستضاف للأحمال الحساسة للخصوصية
السلبيات
- –الاحتفاظ لأربعة عشر يومًا في المجاني قصير إن أردت المقارنة بالشهر الماضي
- –الاستضافة الذاتية تتطلب Enterprise ومحادثة مع المبيعات، دون سعر منشور
- –منصة تجارية، فبخلاف Promptfoo لا يوجد بديل احتياطي إن تغيّرت الأسعار
Weave: خيار Weights & Biases
Weave هي الجواب البديهي إن كان فريقك يتتبع تجاربه أصلًا في Weights & Biases، وأصعب في الإقناع إن لم يكن كذلك. فالحجة هي التكامل نفسه: تصل التقييمات إلى جوار عمليات التشغيل التي تنظر إليها أصلًا.
Weave — الأفضل داخل منظومة Weights & Biases
مجانية بجيغابايت واحد شهريًا ومقاعد غير محدودة، وPro من 60 دولارًا لمن يقل عددهم عن 50 موظفًا
تغطي Weave تقييمات التطبيقات والتتبّع والمقيّمات، وتمنح الباقة المجانية مقاعد Weave غير محدودة مع جيغابايت واحد من الاستيعاب شهريًا، وهو منطلق معقول لفريق صغير. وتبدأ Pro من 60 دولارًا شهريًا بفوترة شهرية مع 1.5 جيغابايت، والاستيعاب الإضافي بـ0.10 دولار لكل ميغابايت. والعقبة في الأهلية أكثر منها في السعر: تنص Weights & Biases على أن Pro «for early-stage teams fewer than 50 employees»، وأن من يتجاوز هذه الإرشادات عليه الانتقال إلى Enterprise. وفي Enterprise تكمن خيارات النشر الجدية، ومنها خيار المستأجر الواحد، والامتثال لمعيار HIPAA، ومفاتيح تشفير يديرها العميل، والدخول الموحّد، وسجلات التدقيق. ولاحظ أن المستأجر الواحد أقرب إلى نسخة مخصصة منه إلى نشر محلي حقيقي، فتأكد من التفاصيل مع W&B قبل افتراض أنه يفي بمتطلب محلي صارم.
الإيجابيات
- +باقة مجانية بمقاعد Weave غير محدودة وجيغابايت واحد من الاستيعاب شهريًا
- +التقييمات تقف إلى جانب تتبّع التجارب والسجل القائمين في W&B
- +تتيح Enterprise المستأجر الواحد وHIPAA ومفاتيح يديرها العميل والدخول الموحّد
- +بستين دولارًا شهريًا، أدنى مدخل مدفوع بين الثلاثة
السلبيات
- –Pro مقصورة على المؤسسات التي يقل عدد موظفيها عن 50، وهو سقف صارم
- –الاحتساب بالاستيعاب عند 0.10 دولار للميغابايت أصعب في التوقع من عدّ التقييمات
- –أضعف حجة قائمة بذاتها إن لم تكن تستخدم Weights & Biases أصلًا
Promptfoo: الخيار المجاني ضمن التكامل المستمر
Promptfoo هي التي لا تكلّف شيئًا عند أي حجم، لأنك تشغّلها بنفسك. فهي واجهة سطر أوامر ومكتبة لا منصة، ومن ثمّ تعيش التقييمات في صورة إعدادات إلى جانب شيفرتك وتُنفَّذ حيث تُنفَّذ اختباراتك أصلًا.
Promptfoo — أفضل خيار مجاني وأصيل في التكامل المستمر
24.6 ألف نجمة، رخصة MIT، مجانية بأي حجم، ومملوكة الآن لـOpenAI
لدى Promptfoo 24,638 نجمة على GitHub ورخصة MIT، وقد حُدّثت في اليوم الذي جرى فيه التحقق من هذه الصفحة، فنشاطها لا لبس فيه. ولأنها تعمل على بنية تحتية تملكها أصلًا، لا يوجد عدّاد لكل تقييم ولا لكل جيغابايت: كلفتك الوحيدة هي استدعاءات واجهة النموذج البرمجية التي تستهلكها التقييمات، وهي كلفة كنت ستدفعها على أي منصة. وتعريف مجموعات البيانات بصيغة YAML أو CSV أو JS أكثر عناءً من النقر في واجهة، لكنه يجعل التقييمات قابلة للمقارنة في طلب سحب، وهي ميزة حقيقية حين ينبغي مراجعة إعدادات التقييم كما تُراجع أي شيفرة أخرى. ويجدر معرفة ماهيتها فعلًا: يصف المشروع نفسه باختبار الموجّهات والوكلاء وأنظمة الاسترجاع، مع اختبار الفريق الأحمر واختبار الاختراق وفحص الثغرات للذكاء الاصطناعي. فالأمن هنا ليس ميزة جانبية، وقد وضعت OpenAI استحواذها في سياق اختبار أمن الوكلاء.
الإيجابيات
- +مجانية عند أي حجم، دون عدّاد للتقييمات ولا للاستيعاب
- +تقييمات في صورة إعدادات خاضعة لإدارة الإصدارات، قابلة للمقارنة والمراجعة في طلب سحب
- +مرخّصة بـMIT، فلا مزوّد تعتمد عليه إن تغيّرت الشروط
- +اختبار الفريق الأحمر وفحص الثغرات من الدرجة الأولى، لا مُضافَين لاحقًا
السلبيات
- –لا واجهة مستضافة افتراضيًا، فلا شيء ينقر عليه من لا يكتبون الشيفرة
- –مجموعات البيانات بصيغتَي YAML وCSV تتطلب إعدادًا أكثر من بنائها في المتصفح
- –مملوكة الآن لـOpenAI، وهو اعتبار حوكمة رغم الالتزام بالمصدر المفتوح
ماذا يعني استحواذ OpenAI بالنسبة إلى Promptfoo
أعلنت OpenAI استحواذها على Promptfoo في 9 مارس 2026، والتزمت علنًا بإبقائها مفتوحة المصدر. ونص تصريح OpenAI: «Promptfoo will remain open source under the current license, and we will continue to service and support current customers.» ونقلت الاستحواذَ حينها TechCrunch وCNBC وForbes، وأكّدته مواقع OpenAI وPromptfoo نفسها.
وتدعم المؤشرات العملية هذا الالتزام حتى الآن. فبعد نحو ستة أشهر، لا يزال المستودع ضمن منظمة `promptfoo`، ولا يزال مرخّصًا بـMIT، وقد حُدّث في اليوم الذي جرى فيه التحقق من هذه الصفحة. وهذا ما يرغب المرء في رؤيته.
أما سبب التفكير في الأمر رغم ذلك فهو الحوكمة لا الرخصة. فأداة التقييم هي ما تحكم به على النماذج، وهي الآن مملوكة لشركة تصنع النماذج. ورخصة MIT تعني أن بإمكانك التفريع إن توقف اتجاه المشروع يومًا عن خدمتك، وهي حماية حقيقية لا يوفّرها Braintrust ولا Weave. لكن إن كانت استراتيجيتك في التقييم تقوم على الحياد بين مزوّدي النماذج، فذلك يستحق قرارًا واعيًا لا افتراضًا صامتًا.
📌Note: ذكرت OpenAI أن تقنية Promptfoo ستُدمج في OpenAI Frontier لأغراض اختبار الفريق الأحمر المؤتمت واختبار أمن الوكلاء. وهذا متسق مع تركيز Promptfoo الأمني القائم، ويشير إلى أن الجانب الأمني قد يحظى باستثمار أكبر من جانب التقييم العام.
كيف تُقارَن الأسعار
تتصاعد الكلفة مع حجم البيانات وإنفاق نموذج الحكم لا مع عدد المقاعد، ولهذا فإن المستخدمين غير المحدودين في الباقات المجانية أنفع مما يبدو للوهلة الأولى. ويسعّر الجدول أدناه حِملًا متوسطًا يقارب 50 ألف تقييم شهريًا.
| السيناريو | Braintrust | Weave | Promptfoo |
|---|---|---|---|
| حد الباقة المجانية | 10 آلاف تقييم، 1 غيغابايت، 14 يومًا | استيعاب 1 غيغابايت شهريًا، مقاعد غير محدودة | بلا حد |
| الباقة المدفوعة | Pro بـ249 دولارًا شهريًا | من 60 دولارًا شهريًا | غير لازمة |
| المشمول في تلك الباقة | 50 ألف تقييم، 5 غيغابايت، 249 دولارًا رصيدًا | استيعاب 1.5 غيغابايت | لا ينطبق |
| 50 ألف تقييم شهريًا | تغطيها Pro بـ249 دولارًا | حسب الجيغابايت، والأرجح تجاوز 1.5 | إنفاق واجهة النموذج فقط |
| سعر التجاوز | 1.50 دولار لكل 1000 تقييم، 3 دولارات للجيغابايت | 0.10 دولار لكل ميغابايت | لا يوجد |
| سقف الأهلية | لا شيء معلن | Pro لمن يقل عددهم عن 50 موظفًا | لا يوجد |
تحتسب Braintrust بالتقييم، وتحتسب Weave بالجيغابايت المستوعب. وليستا وحدتين قابلتين للمقارنة، فقدّر كليهما من حِملك الفعلي قبل اعتبار الستين دولارًا أرخص من 249.
⚠️Warning: تزعم عدة مقارنات أن رصيد Braintrust Pro البالغ 249 دولارًا عرض ترويجي لعام 2026 ينخفض إلى 100 دولار شهريًا بعد 1 سبتمبر 2026. ولا يظهر هذا التاريخ على صفحة أسعار Braintrust التي لا تذكر من العروض سوى «6–12 months free for qualifying startups». سعّر انطلاقًا من صفحة المزوّد لا من مقال مقارنة، وهذا المقال منها.
الاستضافة الذاتية وموقع إقامة البيانات
Promptfoo هي الوحيدة بين الثلاث التي تكون فيها الاستضافة الذاتية هي الوضع الافتراضي لا ترقية مؤسسية. فلأنها واجهة سطر أوامر ومكتبة، لا تغادر حالات اختبارك ولا مخرجات النموذج بيئتك ما لم تختر عمدًا باقة مستضافة. ولفريق يخضع لقواعد إقامة البيانات، فإن هذا يلغي السؤال بدل أن يجيب عنه.
وتوفّر Braintrust نشرًا محليًا أو مستضافًا، لكن في Enterprise وحدها، ما يعني سعرًا مخصصًا ومحادثة مع المبيعات. وهو خيار نشر حقيقي لا عبارة تسويقية، غير أنك لا تستطيع تقييمه ذاتيًا.
وتوفّر باقة Enterprise لدى Weave خيار المستأجر الواحد مع مفاتيح تشفير يديرها العميل، والامتثال لمعيار HIPAA، واتصالًا خاصًا آمنًا. اقرأ ذلك بتمعّن: فالمستأجر الواحد مع مفاتيح خاصة هو نسخة مخصصة، وهذا ليس كالتشغيل داخل نطاقك. فإن كان متطلبك محليًا بصرامة، تأكد من التفاصيل مع Weights & Biases بدل افتراض أن خيار المستأجر الواحد يفي به.
من ينبغي أن يستخدم ماذا
شكل الفريق يحسم هذا أكثر من قوائم الميزات. وخمسة أنماط تغطي معظم القرّاء.
- مطوّرة منفردة تعمل على نموذج أولي ← Promptfoo. لا حساب ولا عدّاد، ولا شيء تزيله إن غيّر المشروع اتجاهه.
- فريق منتج يطلق ميزة نموذج لغوي بمراجعة من إدارة المنتج والجودة ← Braintrust. فالمستخدمون غير المحدودين في الباقة المجانية هم تحديدًا ما يجعل المراجعة متعددة التخصصات ممكنة.
- فريق يستخدم Weights & Biases بالفعل ← Weave، شرط أن تكونوا دون خمسين موظفًا لأجل Pro. وفوق ذلك، سعّر Enterprise قبل المقارنة.
- فريق أمن أو منصة يختبر حقن الموجّهات ← Promptfoo، إذ يتوافق تركيزها على الفريق الأحمر مع المهمة. راجع أيضًا أدوات أمن الموجّهات واختبار الحقن.
- فريق يقيّم عبر عدة مزوّدي نماذج ← Promptfoo أو Braintrust، ووجّه الاستدعاءات عبر بوابة ليصبح تبديل المزوّد تغييرًا في الإعدادات؛ راجع أفضل بوابة واجهات برمجة للنماذج اللغوية.
أدوات التقييم في الاتحاد الأوروبي واليابان والصين
تُبنى مجموعات بيانات التقييم عادةً من حركة الإنتاج، ما يجعلها من أكثر البيانات حساسية في منظومة النماذج اللغوية. وهذا يحوّل الاختيار بين المستضاف والمحلي إلى مسألة امتثال في ثلاث أسواق كبرى.
أخطاء شائعة عند اختيار أداة تقييم
- 1مقارنة 60 دولارًا بـ249 دولارًا دون التحقق من الأهلية
Why it matters: باقة Weave Pro مقصورة على المؤسسات التي يقل عدد موظفيها عن 50. وفوق هذا العدد تصبح المقارنة الحقيقية بين Braintrust Pro وعرض Weave Enterprise مخصص، ورقم الستين دولارًا غير متاح لك أصلًا. - 2وضع ميزانية حول تاريخ انتهاء عرض لدى Braintrust غير منشور
Why it matters: الزعم بأن رصيد Pro ينخفض إلى 100 دولار شهريًا بعد 1 سبتمبر 2026 لا يظهر على صفحة أسعار Braintrust. والتخطيط لهجرة حول تاريخ لم يعلنه المزوّد يهدر الجهد؛ أعد قراءة صفحة الأسعار بدلًا من ذلك. - 3معاملة التقييمات والجيغابايتات كوحدتين قابلتين للمقارنة
Why it matters: تحتسب Braintrust التقييمات وتحتسب Weave الاستيعاب. فحِمل يتّسع بارتياح داخل 50 ألف تقييم قد يتّسع أو لا يتّسع داخل 1.5 جيغابايت تبعًا لحجم آثارك. قدّر كليهما من بياناتك قبل الترتيب بالسعر. - 4تبنّي منصة لمجموعة من خمس عشرة حالة
Why it matters: دون نحو عشرين حالة اختبار، يؤدي سكربت يمنح درجات ضمن التكامل المستمر العمل نفسه بلا حساب ولا عدّاد ولا حد للاحتفاظ. والمنصات تستحق ثمنها حين تصبح إدارة مجموعة البيانات، لا التقييم، هي عنق الزجاجة. - 5افتراض أن المستأجر الواحد يعني النشر المحلي
Why it matters: خيار Enterprise بمستأجر واحد لدى Weave مع مفاتيح يديرها العميل هو نسخة مخصصة، لا نشر داخل نطاقك. فإن كان متطلبك محليًا بصرامة، تأكد من ذلك مع W&B بدل قراءة المستأجر الواحد بوصفه مكافئًا.
تجاوز هذا إن…
إن كانت مجموعة اختبارك اثني عشر موجّهًا تشغّلها مهندسة واحدة، فتجاوز الثلاثة واكتب سكربتًا يمنح درجات ضمن التكامل المستمر. ستحصل على إشارة الانحدار نفسها بلا حساب ولا عدّاد ولا نافذة احتفاظ، وستستطيع الانتقال إلى منصة لاحقًا دون أن تكون قد خسرت شيئًا، لأن الأصل هو مجموعة البيانات وهي تنتقل معك.
والعتبة التي يستحق انتظارها هي حين تصبح إدارة مجموعة البيانات هي العمل نفسه: حين تريد سحب الحالات الفاشلة من الإنتاج إلى مجموعة الاختبار بصورة روتينية، أو حين يحتاج من لا يكتب الشيفرة إلى منح المخرجات درجات، أو حين تحتاج إلى مقارنة نتائج هذا الشهر بنتائج الربع الماضي. هذه مشكلات إدارة بيانات، وهي ما تشتريه فعلًا. أما التقييم نفسه فقد كان دائمًا الجزء السهل.
💡Tip: محفّز عملي: تبنَّ منصة أول مرة تجد نفسك فيها تبني جدولًا لتتبّع أي نسخة من الموجّه حصلت على أي درجة. فذلك الجدول هو المنتج الذي أنت على وشك شرائه، وشراؤه أرخص من صيانته.
الأسئلة الشائعة
ما أفضل أداة لتقييم النماذج اللغوية في 2026؟
Braintrust للفرق التي يراجع فيها غير المبرمجين النتائج، بفضل المستخدمين غير المحدودين حتى في الباقة المجانية. وWeave إن كنت تستخدم Weights & Biases أصلًا وعدد موظفيكم دون الخمسين. وPromptfoo إن أردت تقييمات في صورة إعدادات خاضعة لإدارة الإصدارات تعمل مجانًا على بنيتك التحتية. والثلاثة تغطي استخدام نموذج لغوي كحكم والمقيّمات المخصصة واختبارات الانحدار.
هل استحوذت OpenAI على Promptfoo؟
نعم. أعلنت OpenAI الاستحواذ في 9 مارس 2026 وذكرت أن Promptfoo ستبقى مفتوحة المصدر بموجب رخصتها الحالية وأن العملاء الحاليين سيستمرون في تلقّي الخدمة والدعم. وحتى أواخر أغسطس 2026 لا يزال المستودع ضمن منظمة promptfoo، ولا يزال مرخّصًا بـMIT، ويحظى بصيانة نشطة.
كم تكلّف Braintrust؟
تشمل باقة Starter المجانية 10 آلاف تقييم شهريًا، وجيغابايت واحدًا من البيانات المعالجة، واحتفاظًا لأربعة عشر يومًا، و10 دولارات رصيد نماذج، ومستخدمين غير محدودين. وباقة Pro بـ249 دولارًا شهريًا وتشمل 249 دولارًا رصيدًا، و50 ألف تقييم، و5 جيغابايت، واحتفاظًا لثلاثين يومًا، مع تجاوز بـ1.50 دولار لكل 1000 تقييم. وEnterprise بسعر مخصص وتضيف نشرًا محليًا أو مستضافًا.
هل Weave مجانية وما حدودها؟
لدى Weave باقة مجانية بمقاعد غير محدودة وجيغابايت واحد من استيعاب البيانات شهريًا. وتبدأ Pro من 60 دولارًا شهريًا مع 1.5 جيغابايت، لكن Weights & Biases تقصرها على الفرق في مراحلها الأولى التي يقل عدد موظفيها عن 50؛ والمؤسسات الأكبر عليها الانتقال إلى Enterprise. والاستيعاب الإضافي بـ0.10 دولار لكل ميغابايت.
هل Promptfoo مجانية فعلًا عند أي حجم؟
نعم، بمعنى أن الأداة نفسها مرخّصة بـMIT وتعمل على أجهزتك، فلا رسوم لكل تقييم ولا لكل جيغابايت. ولا تزال تدفع مقابل استدعاءات واجهة النموذج البرمجية التي تجريها التقييمات، لكن هذه الكلفة قائمة على أي منصة وليست خاصة بـPromptfoo. وتوجد فوق ذلك باقة Enterprise مستضافة اختيارية.
أيها يمكنني استضافته ذاتيًا؟
Promptfoo افتراضيًا، لأنها واجهة سطر أوامر ومكتبة تعمل حيث تشغّلها. وتوفّر Braintrust نشرًا محليًا أو مستضافًا في خطة Enterprise. وتوفّر Weave خيار Enterprise بمستأجر واحد مع مفاتيح يديرها العميل، وهو نسخة مخصصة أكثر منه نشرًا محليًا حقيقيًا، فتأكد من التفاصيل إن كان لديك متطلب صارم.
هل لأي منها برنامج عمولة؟
لم نجد برنامج عمولة أو إحالة علنيًا لصنّاع المحتوى لدى Braintrust ولا Weights & Biases ولا Promptfoo. وتدير Weights & Biases برنامج شركاء، لكن صفحته العلنية تصف شراكات إعادة بيع وتكامل تقني موجّهة إلى بيوت الاستشارات، لا دفعًا مقابل كل إحالة. ولاحظ أيضًا أن usebraintrust.com سوق مواهب منفصل لا صلة له بـbraintrust.dev. ومنصة PromptQuorum لا تكسب شيئًا من هذه الصفحة.
ما الفرق بين التقييم والمراقبة؟
يشغّل التقييم مجموعة بيانات ثابتة قبل الإطلاق ويخبرك إن كان التغيير قد حسّن الجودة أو أضعفها. أما المراقبة فتتابع الحركة الحية بعد الإطلاق وتخبرك بما يفعله النظام الآن. وهذه الصفحة تغطي الأول. والاثنان متكاملان وكثير من الفرق يمارس كليهما، لكن الأدوات والأسئلة مختلفة.
الخلاصة النهائية
- استخدم Braintrust إن كان على من لا يكتبون الشيفرة مراجعة النتائج — الخطوة التالية: ابدأ بالباقة المجانية التي تتيح مستخدمين غير محدودين، وتحقق مما إذا كان مديرو المنتج يفتحونها فعلًا قبل أن تدفع مقابل Pro.
- استخدم Weave إن كانت Weights & Biases نظام السجل لديك أصلًا — الخطوة التالية: تأكد أنك دون سقف الخمسين موظفًا قبل الاعتماد على باقة الستين دولارًا، وسعّر Enterprise إن لم تكن كذلك.
- استخدم Promptfoo إن أردت تقييمات في صورة إعدادات قابلة للمراجعة دون عدّاد مزوّد — الخطوة التالية: اكتب أول مجموعة بيانات بصيغة YAML وشغّلها في التكامل المستمر قبل تقييم أي حل مستضاف.
- استخدم Promptfoo تحديدًا إن كنت تختبر حقن الموجّهات وأمن الوكلاء لا جودة المخرجات وحدها — الخطوة التالية: ابدأ بميزات الفريق الأحمر، فهي وجهة استثمار OpenAI.
- تجاوز الثلاثة إن كان لديك اثنتا عشرة حالة اختبار ومهندسة واحدة — الخطوة التالية: اكتب سكربتًا يمنح درجات ضمن التكامل المستمر وأعد النظر حين تصبح إدارة مجموعة البيانات هي عنق الزجاجة.