Key Takeaways
- المستوى 1 (بسيط): `ollama run llama3.2` + OpenWebUI. لا يلزم كود.
- المستوى 2 (قياسي): vLLM + غلاف FastAPI. Python 3.10+، تثبيت pip لحزمتين، إعداد في 30 دقيقة.
- المستوى 3 (إنتاج): vLLM + موازِن تحميل nginx + مراقبة (Prometheus). متعدد GPU، متعدد المستخدمين، متحمِّل للأعطال.
- التكامل مع IDE: VS Code Copilot أو Cursor مع نقطة نهاية واجهة OpenAI الخاصة بـ vLLM.
- المعالجة على دفعات: أرسل 10 مطالبات في آن واحد، واستقبل 10 ردود بالتوازي (لا على نحو متسلسل).
- التكلفة: صفر (مفتوح المصدر) مقابل 20 دولارًا/شهر (Claude Pro) أو 200 دولار/شهر (فريق كبير في السحابة).
- السرعة: يبلغ المستوى 2 سرعة 30-50 token/ثانية للبرمجة. ويبلغ المستوى 3 سرعة 200+ token/ثانية بين المستخدمين.
- التعقيد: المستوى 1 (1/10)، المستوى 2 (4/10)، المستوى 3 (8/10).
المستويات الثلاثة
اختر بناءً على حالة الاستخدام:
- المستوى 1: مطوِّر فردي، استخدام عَرَضي، بلا خادم API. Ollama + واجهة محادثة.
- المستوى 2: مطوِّر فردي، تكامل مع IDE، سكربتات مخصصة. vLLM + FastAPI.
- المستوى 3: نشر للفريق، 5+ مطورين، خدمة دائمة التشغيل. vLLM + nginx + مراقبة.
المستوى 1: بدء سريع بـ CLI (5 دقائق)
للبرمجة: ثبِّت امتداد "Continue" في VS Code (`continue.dev`)، ووجِّهه إلى واجهة Ollama، واحصل على إكمالات في الوقت الفعلي.
- 1`brew install ollama` (macOS) أو تنزيل المثبِّت لنظام Windows.
- 2`ollama run llama3.2` (تنزيل النموذج 8B وتشغيله).
- 3افتح المتصفح: `http://localhost:11434` (واجهة ويب Ollama).
- 4ابدأ المحادثة. انتهى الأمر.
المستوى 2: خادم API بـ FastAPI (30 دقيقة)
لماذا FastAPI: نقطة نهاية متوافقة مع OpenAI. بديل مباشر لواجهة OpenAI الفعلية في كودك.
- 1ثبِّت Python 3.10+: `python --version`.
- 2ثبِّت vLLM: `pip install vllm torch`.
- 3ابدأ خادم vLLM: `python -m vllm.entrypoints.openai.api_server --model meta-llama/Llama-3.3-8B-Instruct --port 8000`.
- 4اختبر نقطة النهاية: `curl http://localhost:8000/v1/chat/completions -d '{"model": "Llama-3.1-8B-Instruct", "messages": [{"role": "user", "content": "Write Python code for Fibonacci"}]}' -H "Content-Type: application/json"`.
- 5الدمج في IDE: وجِّه امتداد Copilot إلى `http://localhost:8000`.
- 6الطلبات على دفعات: أرسل عدة مطالبات بالتوازي؛ يعالجها vLLM جميعًا في آن واحد.
المستوى 3: إنتاج متعدد المستخدمين (ساعتان)
يتوسع إلى 50+ مطورًا متزامنًا (5 token/ثانية لكل منهم) على جهاز بـ GPU مزدوجة. التكلفة: الكهرباء فقط (نحو 100 دولار/شهر إذا كان نشطًا على مدار الساعة).
- 1انشر نسختين من vLLM على وحدات GPU منفصلة (GPU 0، GPU 1).
- 2اضبط nginx لموازنة الطلبات بين النسختين.
- 3اضبط Prometheus لجمع المقاييس (زمن استجابة الطلبات، token/ثانية، الأخطاء).
- 4أضِف تحديد المعدل لكل مستخدم (خوارزمية token bucket).
- 5انشر على VM سحابية أو خادم محلي بشبكة 10 Gbps.
- 6راقب عبر لوحة Grafana (اختياري).
التكامل مع IDE (VS Code وCursor)
الإعداد لإكمال الكود في الوقت الفعلي:
البديل (دعم IDE الأصلي): يتمتع محرر Cursor بدعم مدمج لنماذج LLM المحلية (لا يلزم امتداد).
- 1ثبِّت امتداد "Continue" (`continue.dev`).
- 2افتح إعدادات الامتداد واضبط واجهة API المخصصة: `http://localhost:8000/v1` (نقطة نهاية vLLM).
- 3اضبط اسم النموذج ليطابق خادم vLLM (`meta-llama/Llama-3.3-8B-Instruct`).
- 4اضغط Ctrl+Shift+Space (أو cmd+shift+space) لتفعيل الإكمال.
- 5تُبَث الإكمالات في الوقت الفعلي (10-20 token/ثانية).
التصحيح والمراقبة
- سجلات vLLM: راجع stdout بحثًا عن الأخطاء (تحميل النموذج، OOM، أخطاء CUDA).
- مقاييس Prometheus: يصدِّر vLLM نقطة نهاية `/metrics` (عدد الطلبات، مدرَّج تكراري لزمن الاستجابة، الـ token المولَّدة).
- عد الـ token: استخدم مكتبة `tiktoken` لعد الـ token قبل الإرسال (تجنب مفاجآت OOM).
- تحليل زمن الاستجابة: أضِف تسجيل الطوابع الزمنية قبل/بعد استدعاء vLLM لتحديد الاختناقات.
السياق الإقليمي والامتثال التنظيمي
- الاتحاد الأوروبي / RGPD (أوروبا): يلبي الاستدلال المحلي المادة 28 من اللائحة العامة لحماية البيانات -- لا تغادر أي بيانات بنيتك التحتية. لا يلزم اتفاق معالجة بيانات. موصى به لأحمال العمل في الرعاية الصحية والقانون والمالية.
- اليابان / METI: توصي إرشادات حوكمة الذكاء الاصطناعي الصادرة عن METI 2024 بالاستدلال المحلي للبيانات المؤسسية الحساسة. يفي إعداد vLLM + المستوى 3 بمتطلبات التدقيق الخاصة بـ METI.
- الصين / PIPL: يتطلب قانون حماية المعلومات الشخصية الصيني (2021) إقامة البيانات. تُبقي الحزمة المحلية من المستوى 2/3 كل الاستدلال داخل البلاد. متوافق مع نسخ GPU من Alibaba Cloud وTencent Cloud.
- الولايات المتحدة: لا يوجد تفويض فيدرالي لإقامة بيانات الذكاء الاصطناعي اعتبارًا من 2026. يجب على الكيانات الخاضعة لـ HIPAA ضمان عدم مغادرة المعلومات الصحية المحمية للبنية التحتية الخاضعة للرقابة -- يفي المستوى 2/3 بذلك افتراضيًا.
أخطاء الإعداد الشائعة
- تشغيل vLLM على GPU نفسها مع عملية أخرى (Discord، الألعاب). يسبب أخطاء نفاد ذاكرة GPU.
- إرسال الطلبات دون مهلة. إذا تعطل vLLM، ينتظر العميل إلى ما لا نهاية. اضبط دائمًا `timeout=60` في الطلبات.
- افتراض أن vLLM يتوسع تلقائيًا على عدة وحدات GPU. يتطلب علامة `--tensor-parallel-size` الصريحة.
- نسيان ضبط CUDA_VISIBLE_DEVICES في إعدادات متعددة GPU. يستخدم vLLM جميع وحدات GPU افتراضيًا.
- استخدام نماذج Llama 3.3 في 2026. أوقفت Meta دعم Llama 3.3 للاستخدام التجاري في يناير 2026. استخدم Llama 3.3 8B Instruct (رخصة Apache 2.0، بلا قيود).
- استخدام Llama 3.3 عندما يتوفر Llama 3.3. يتمتع Llama 3.3 8B Instruct باتباع أفضل للتعليمات وهو الافتراضي الموصى به اعتبارًا من أبريل 2026. استخدم `ollama run llama3.3:8b-instruct`.
الأسئلة الشائعة
أي مستوى ينبغي أن أستخدم؟
المستوى 1 للاستخدام الفردي (العَرَضي). المستوى 2 لمطوِّر واحد بتكامل IDE. المستوى 3 للفرق بخدمة على مدار الساعة.
هل يمكنني استخدام vLLM بدلًا من Ollama؟
نعم، لكنه يتطلب مزيدًا من الإعداد. vLLM أسرع (المعالجة على دفعات) وأكثر مرونة (واجهة Python).
كيف أُقدِّم النماذج على عدة وحدات GPU؟
vLLM: `--tensor-parallel-size 2`. يقسِّم النموذج على وحدتي GPU لمضاعفة معدل المعالجة.
هل يمكنني إجراء الضبط الدقيق فوق استدلال vLLM؟
لا. أجرِ الضبط الدقيق على نحو منفصل (HuggingFace Transformers) ثم حمِّل النموذج المُعدَّل في vLLM.
ماذا أفعل إذا أنتج vLLM خطأ OOM؟
استخدم تكميمًا أصغر (Q4 بدلًا من Q8)، أو قلِّل حجم الدفعة، أو خصِّص قدرًا أقل من VRAM لكل نموذج. راجع `nvidia-smi`.
هل المستوى 3 جاهز للإنتاج؟
نعم، مع المراقبة. أضِف Prometheus وGrafana والتنبيهات (Alertmanager). أنماط بنية تحتية قياسية.
المصادر
- vLLM OpenAI-Compatible Server Documentation -- الدليل الرسمي لإعداد خادم API الخاص بـ vLLM
- Continue.dev Configuration Documentation -- إعداد امتداد IDE لنقاط نهاية OpenAI المخصصة
- Meta Llama 3.3 Model Card -- Meta. نموذج instruct محدَّث، Apache 2.0. بديل موصى به لـ Llama 3.3 8B.
- Qwen3-Coder Model Card -- Alibaba. 82% HumanEval، رخصة Apache 2.0. النموذج الأعلى أداءً للبرمجة بأقل من 8 GB من VRAM وفق اختباراتنا.