Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/خادم ⁨LLM⁩ محلي للفرق المؤسسية: وصول متعدد المستخدمين والتحكم في التكاليف
Privacy & Business

خادم ⁨LLM⁩ محلي للفرق المؤسسية: وصول متعدد المستخدمين والتحكم في التكاليف

·10 دقائق للقراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

انشر خادم LLM محليًا مشتركًا لـ5-20 عضوًا في الفريق باستخدام vLLM + موازن أحمال nginx. اعتبارًا من أبريل 2026، يكلّف الاستدلال على مستوى الفريق 50$ شهريًا (كهرباء) مقابل 1,000$+ شهريًا في واجهات API السحابية.

انشر خادم LLM محليًا مشتركًا لـ5-20 عضوًا في الفريق باستخدام vLLM + موازن أحمال nginx. اعتبارًا من أبريل 2026، يكلّف الاستدلال على مستوى الفريق 50$ شهريًا (كهرباء) مقابل 1,000$+ شهريًا (واجهات API السحابية). يغطي هذا الدليل الوصول متعدد المستخدمين والأذونات القائمة على الأدوار وقياس الاستخدام وعزو التكاليف.

العرض التقديمي: خادم ⁨LLM⁩ محلي للفرق المؤسسية: وصول متعدد المستخدمين والتحكم في التكاليف

يغطي العرض التقديمي: معماريات خادم LLM للفرق (فردي، ثنائي GPU، مؤسسي)، مقارنة التكاليف (600$ سنويًا مقابل 12,000$+)، المصادقة وضبط الوصول، قياس الاستخدام وعزو التكاليف، استراتيجيات التوسع، مراقبة الأداء وأخطاء الإعداد الشائعة. نزّل ملف PDF كبطاقة مرجعية لنشر LLM في الفريق.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

Key Takeaways

  • فريق صغير (5-10): خادم واحد (vLLM) + nginx + مصادقة = 3 آلاف $ عتاد، 50$ شهريًا كهرباء.
  • فريق متوسط (10-50): عنقود ثنائي GPU + موازن أحمال + مراقبة Prometheus = 6 آلاف $ عتاد، 100$ شهريًا كهرباء.
  • فريق كبير (50+): إعداد مؤسسي بتكرار وطبقة تخزين مؤقت (Redis) وتوسع تلقائي = ميزانية مخصصة.
  • التكلفة لكل مستخدم: 10-100$ شهريًا حسب حجم الاستدلال (مقابل 200-500$ شهريًا في واجهات API السحابية).
  • وقت الإعداد: خادم واحد = يوم واحد. عنقود = أسبوع واحد. مؤسسي = شهر واحد (يشمل تدقيق الأمان).
  • مصادقة API: OAuth 2.0 (SSO عبر AD/Okta) للمؤسسات. مصادقة بسيطة بالرمز للشركات الصغيرة والمتوسطة.
  • تتبع الاستخدام: كل استعلام مُسجَّل بمعرّف المستخدم والطابع الزمني والرموز المولّدة (لعزو التكاليف).
  • العبء الإداري: ضئيل (مراقبة آلية). حدث التوسع = إضافة بطاقة GPU + إعادة الموازنة (دون تغييرات في الشيفرة).
السنة 1: يكلّف LLM المحلي 3,100$ عتاد + كهرباء مقابل 12,000$–36,000$ في واجهات API السحابية. السنة 3+: تنخفض التكلفة الشهرية إلى 120$ موزّعة، موفّرة أكثر من 16,000$ سنويًا للفرق النشطة.
السنة 1: يكلّف LLM المحلي 3,100$ عتاد + كهرباء مقابل 12,000$–36,000$ في واجهات API السحابية. السنة 3+: تنخفض التكلفة الشهرية إلى 120$ موزّعة، موفّرة أكثر من 16,000$ سنويًا للفرق النشطة.

أي معمارية: خادم واحد أم عنقود متعدد GPU؟

خادم vLLM واحد (5-10 مستخدمين):

  • 1× RTX 4090 + 64GB RAM + 1TB SSD.
  • يتعامل مع 10 مستخدمين متزامنين (5 رموز/ث لكل منهم).
  • التكلفة: 2,500$ عتاد + 50$ شهريًا كهرباء.

عنقود ثنائي GPU (10-50 مستخدمًا):

  • 2× مثيل vLLM (واحد لكل GPU) + موازن أحمال nginx.
  • يتعامل مع 20 مستخدمًا متزامنًا (10 رموز/ث لكل منهم).
  • التكلفة: 5,000$ عتاد + 100$ شهريًا كهرباء.

طبقة تخزين مؤقت Redis (اختيارية):

  • تخزّن المطالبات المتكررة مؤقتًا (رسائل النظام، القوالب).
  • خفض 30% في زمن الاستجابة للاستعلامات المتكررة.
  • التكلفة: ألف $ عتاد إضافي.
يتعامل خادم vLLM واحد مع 5-10 مستخدمين بإعداد بسيط لكن بنقطة فشل واحدة. يوفّر العنقود الثنائي GPU (10-50 مستخدمًا) تجاوز فشل تلقائيًا وإنتاجية أعلى مع موازنة الأحمال.
يتعامل خادم vLLM واحد مع 5-10 مستخدمين بإعداد بسيط لكن بنقطة فشل واحدة. يوفّر العنقود الثنائي GPU (10-50 مستخدمًا) تجاوز فشل تلقائيًا وإنتاجية أعلى مع موازنة الأحمال.

كيف تُعِدّ مصادقة المستخدمين وضبط الوصول؟

مصادقة بسيطة (شركات صغيرة ومتوسطة < 50 مستخدمًا): مفتاح API لكل مستخدم. يرسل المستخدم `Authorization: Bearer $API_KEY` في ترويسة الطلب. للامتثال التنظيمي، راجع الامتثال المؤسسي مع نماذج LLM المحلية.

مصادقة مؤسسية: OAuth 2.0 + SAML 2.0 مع تكامل Okta/Azure AD. تسجيل دخول SSO، وتعيين تلقائي للمجموعات.

تحديد المعدل (Rate limiting): حصة رموز لكل مستخدم (مثال: 100 ألف رمز/يوم). يمنع فريقًا واحدًا من إغراق الخادم.

تسجيل التدقيق: سجّل كل مكالمة API بمعرّف المستخدم وعنوان IP وحجم الطلب وحجم الاستجابة والطابع الزمني.

مصادقة بسيطة بالرمز للشركات الصغيرة والمتوسطة وOAuth 2.0 مع SAML 2.0 لتكامل SSO المؤسسي مع تعيين تلقائي للمجموعات وضبط وصول قائم على الأدوار.
مصادقة بسيطة بالرمز للشركات الصغيرة والمتوسطة وOAuth 2.0 مع SAML 2.0 لتكامل SSO المؤسسي مع تعيين تلقائي للمجموعات وضبط وصول قائم على الأدوار.

كيف تتتبّع عزو التكاليف وقياس الاستخدام؟

التتبع: الرموز المولّدة لكل مستخدم يوميًا. اجمعها عبر الفريق للحصول على التكلفة الإجمالية. راجع LLM محلي خاص للبيانات الحساسة للقياس مع إعطاء الأولوية للخصوصية.

العزو: وزّع تكلفة الخادم تناسبيًا (مثال: إذا ولّدت Alice 40% من الرموز، تتحمّل 40% من الفاتورة).

تقرير showback: تقرير شهري لكل مستخدم: الرموز المستخدمة، تكلفة API السحابية المقدّرة، التكلفة الداخلية والوفورات.

الأدوات: Prometheus + خدمة فوترة مخصصة. أو الخيار مفتوح المصدر: Metered.io (تتبع تكاليف قائم على السحابة).

كيف توسّع خوادم LLM المحلية مع نمو الفريق؟

5-10 مستخدمين: 1× RTX 4090. يتشبّع الخادم عندما يُشغّل الجميع الاستدلال في آن واحد. ذروات زمن استجابة مقبولة.

10-30 مستخدمًا: 2× RTX 4090 (جهاز ثنائي GPU). يوزّع موازن أحمال nginx الحمل. 20 مستخدمًا متزامنًا = مريح.

30-100 مستخدم: عنقود من 3-4× GPU (أجهزة منفصلة) + موازن أحمال مخصص (عتاد أو برمجيات). Kubernetes اختياري.

100+ مستخدم: معمارية مؤسسية (تجاوز فشل سحابي، طبقة تخزين مؤقت، بوابة API) = ضع في اعتبارك النموذج الهجين (محلي + اندفاع سحابي).

تدرّج التوسع من 5-10 مستخدمين على GPU واحدة إلى 100+ مستخدم في نشر مؤسسي متعدد المناطق. تزداد متطلبات العتاد ووقت الإعداد مع حجم الفريق.
تدرّج التوسع من 5-10 مستخدمين على GPU واحدة إلى 100+ مستخدم في نشر مؤسسي متعدد المناطق. تزداد متطلبات العتاد ووقت الإعداد مع حجم الفريق.

كيف تراقب الأداء وتحل المشكلات؟

مقاييس Prometheus: يُصدِّر vLLM زمن استجابة الطلبات والرموز/ث وطول الطابور. اجمع البيانات كل 15 ثانية.

لوحة Grafana: تصوّر عمق الطابور ونسب زمن الاستجابة المئوية (p50، p99) واستخدام GPU.

التنبيهات: إذا كان زمن الاستجابة > ثانيتين أو الطابور > 10 طلبات، أبلغ المهندس المناوب.

السجلات: مركّز سجلات vLLM + nginx في ELK Stack. ابحث حسب المستخدم والطابع الزمني والخطأ.

تحديد الاختناقات: إذا كانت GPU مشبّعة (>90% استخدام) وزمن الاستجابة > ثانية، أضف GPU. إذا كان CPU مشبّعًا، رقِّ CPU.

لوحة مقاييس Prometheus في الوقت الفعلي مع استخدام GPU وزمن استجابة الطلبات وعمق الطابور والإنتاجية. تُفعَّل التنبيهات عندما يتجاوز زمن الاستجابة ثانيتين أو يتجاوز الطابور 10 طلبات.
لوحة مقاييس Prometheus في الوقت الفعلي مع استخدام GPU وزمن استجابة الطلبات وعمق الطابور والإنتاجية. تُفعَّل التنبيهات عندما يتجاوز زمن الاستجابة ثانيتين أو يتجاوز الطابور 10 طلبات.

أخطاء الإعداد الشائعة

  • نقطة فشل واحدة (GPU واحدة، بلا تجاوز فشل). إذا تعطّلت GPU، يفقد الفريق الوصول. استخدم ثنائي GPU على الأقل.
  • بلا تحديد معدل. يُشغّل مستخدم استدلال مليون رمز ويحجب الجميع. طبّق حصص الرموز.
  • بلا سجلات تدقيق. لا يمكنك تتبّع من وصل إلى أي بيانات. التسجيل إلزامي لفرق الامتثال.

الأسئلة الشائعة

هل يمكنني إضافة المزيد من المستخدمين دون شراء عتاد جديد؟

حتى 20-30 مستخدمًا متزامنًا لكل GPU. بعد ذلك، أضف RTX 4090 ثانية وأعِد موازنة الحمل بـnginx. تتعامل RTX 4090 مع حوالي 5 رموز/ثانية لكل مستخدم متزامن.

كيف أدير تحديثات النماذج (متغيّر جديد من Llama 3)؟

نزّل النموذج الجديد على جهاز منفصل واختبره قبل النشر. يدعم vLLM التبديل السريع للنماذج عبر إيقاف الطلبات الجديدة مؤقتًا، وإنهاء الاستعلامات الجارية، وتبديل ملفات النموذج بصفر وقت تعطل.

هل يجب أن أستخدم Kubernetes للنشر في الفريق؟

ليس ضروريًا لأقل من 50 مستخدمًا. Docker + docker-compose أبسط وأكثر شفافية ويتطلب عبئًا تشغيليًا أقل. يضيف Kubernetes تعقيدًا دون فائدة مقابلة للفرق الصغيرة.

هل يمكنني محاسبة المستخدمين بناءً على الرموز؟

نعم، عبر تقارير showback باستخدام مقاييس Prometheus. تتبّع الرموز لكل مستخدم يوميًا ووزّع تكاليف الخادم تناسبيًا. حدّد سياستك أولًا: تكلفة مشتركة عبر الفريق أو chargeback حسب القسم.

ماذا يحدث إذا حذف مستخدم بيانات من الخادم عن طريق الخطأ؟

اعمل نسخًا احتياطية يومية لجميع سجلات المدخلات/المخرجات على تخزين خارجي. استخدم إعداد RAID-6 (يتحمل عطل قرصين متزامنين) لتكرار العتاد. اختبر إجراءات الاستعادة شهريًا للتأكد من صلاحية النسخ الاحتياطية.

هل يمكنني التكامل مع Slack/Teams للوصول السهل؟

نعم. ابنِ بوت Slack يستدعي واجهة API لـvLLM ويُعيد الردود في القناة. تكامل شائع: استخدم غلاف OpenAI API لـSlack، متوافق مع نقطة النهاية المتوافقة مع OpenAI في vLLM.

المصادر

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs