Key Takeaways
- أسرع مسار: ثبّت Ollama ← نفّذ `ollama run llama3.2` ← دردش في طرفيتك. الوقت الإجمالي: أقل من 5 دقائق باتصال سريع.
- للأجهزة بسعة 8 GB من RAM: ابدأ بـ `llama3.2:3b` (تنزيل 2 GB) أو `phi4-mini` (2.3 GB). كلاهما يعمل على أي حاسوب محمول حديث.
- توقّع 15-40 token/ثانية على CPU و60-120 token/ثانية على بطاقة رسوم متوسطة المواصفات أو Apple Silicon.
- قد تبدو الاستجابات الأولى أبطأ من واجهات API السحابية — تبادل النماذج المحلية السرعة مقابل الخصوصية والتكلفة الصفرية.
- بعد التنزيل الأولي للنموذج، يعمل كل شيء دون اتصال. لا حاجة للإنترنت للجلسات اللاحقة.
الخطوة 1: تثبيت Ollama
Ollama هو أسرع طريقة لتشغيل نموذج LLM محلي. ثبّته بأمر واحد أو تنزيل من دقيقتين:
# macOS (Homebrew)
brew install ollama
# Linux
curl -fsSL https://ollama.com/install.sh | sh
# Windows: download installer from ollama.com/downloadتحقق من أن Ollama قيد التشغيل
بعد التثبيت، تأكد من أن Ollama نشط:
curl http://localhost:11434
# Expected output: Ollama is runningالخطوة 2: اختيار أول نموذج
اختر نموذجًا حسب RAM المتاح. إذا كنت في شك، ابدأ بـ `llama3.2:3b` — يعمل على أي جهاز بسعة 4 GB من RAM وينتج نتائج مفيدة:
| Tu RAM | Modelo recomendado | Tamaño de descarga | Por qué |
|---|---|---|---|
| 4 GB | llama3.2:1b | ~1.3 GB | أصغر نموذج Llama مفيد |
| 8 GB | Llama 3.2 3B | ~2 GB | أفضل نسبة جودة/حجم للمبتدئين |
| 8-16 GB | Llama 3.3 8B | ~4.7 GB | نموذج عام عالي الأداء |
| 16+ GB | mistral:7b أو qwen2.5:7b | ~4-5 GB | جودة تنافسية، استدلال سريع |
الخطوة 3: تنزيل النموذج
نزّل النموذج بـ `ollama pull`. يُحفظ النموذج في `~/.ollama/models` ويحتاج إلى التنزيل مرة واحدة فقط:
ollama pull llama3.2
# Or pull a specific size variant
ollama pull llama3.2:3b
ollama pull llama3.1:8bكيف يبدو التنزيل؟
يعرض Ollama تقدّم التنزيل في الطرفية. يستغرق نموذج `llama3.2:3b` 2-5 دقائق على اتصال نطاق عريض نموذجي. يُخزَّن النموذج مضغوطًا — الـ 2 GB المُنزَّلة تتوسّع إلى نحو 2.3 GB على القرص.
pulling manifest
pulling 966de95ca8dc... 100% ▕████████████████▏ 1.9 GB
pulling 9f436a92eb8b... 100% ▕████████████████▏ 42 B
verifying sha256 digest
writing manifest
successالخطوة 4: تشغيل النموذج وإرسال أول أمر
ابدأ جلسة دردشة تفاعلية:
ollama run llama3.2
# Ollama loads the model and shows a prompt:
>>> Send a message (/? for help)محادثتك الأولى
اكتب رسالة واضغط Enter. يبثّ النموذج استجابته token بـ token:
>>> What are local LLMs?
Local LLMs (large language models) are AI models that run entirely
on your own hardware -- your laptop, desktop, or server. Unlike cloud
services such as ChatGPT or Claude, local LLMs process everything
locally with no data sent to external servers...ماذا تتوقع: السرعة والجودة والقيود
السرعة تتفاوت حسب الأجهزة. على حاسوب محمول من 2023 (بلا بطاقة رسوم): توقّع 15-25 token/ثانية لنموذج 3B و8-15 token/ثانية لنموذج 8B. على Apple M3 Pro: 50-80 token/ثانية لنموذج 8B. على NVIDIA RTX 4070 Ti: 90-130 token/ثانية لنموذج 8B.
جودة `llama3.2:3b` أدنى بشكل ملحوظ من GPT-5.5 أو Claude Opus 4.8 في المهام المعقدة. للتلخيص والأسئلة والأجوبة البسيطة وشرح الكود، النتيجة مفيدة. للاستدلال متعدد الخطوات أو الكتابة الطويلة، رقِّ إلى نموذج 8B أو 13B.
نافذة السياق: يدعم `llama3.2:3b` 128K token افتراضيًا في Ollama. عمليًا، تتدهور الجودة بعد ~16K token في محادثة واحدة.
تأخير الاستجابة الأولى: تتضمن الاستجابة الأولى بعد `ollama run` وقت تحميل النموذج (5-30 ثانية). الاستجابات اللاحقة في الجلسة نفسها أسرع.
كيف تستخدم نموذج LLM المحلي خارج الطرفية؟
الدردشة في طرفية Ollama مفيدة للاختبار، لكن معظم حالات الاستخدام الفعلية تحتاج إلى واجهة أفضل:
- Open WebUI: واجهة ويب كاملة لـ Ollama. شغّلها بـ Docker: `docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway ghcr.io/open-webui/open-webui:main`. ادخل عبر http://localhost:3000.
- LM Studio: إذا كنت تفضّل واجهة سطح مكتب، يغطي كيفية تثبيت LM Studio الإعداد الكامل. الدردشة المدمجة في LM Studio مصقولة وتدعم سجل المحادثات.
- تكامل API: واجهة API الخاصة بـ Ollama على `localhost:11434` متوافقة مع SDK الخاص بـ OpenAI. أي تطبيق يقبل عنوان URL أساسيًا لـ OpenAI يمكنه الاتصال بنموذجك المحلي.
- VS Code / Cursor: تتصل إضافات مثل Continue.dev بـ Ollama وتوفّر مساعدة برمجية بذكاء اصطناعي محلي مباشرة في محررك.
تشغيل أول نموذج LLM محلي: السياق الإقليمي
الاتحاد الأوروبي / GDPR: تشغيل نموذج LLM محلي مع Ollama يعني أن أي بيانات أمر أو سياق أو مخرجات لا تغادر جهازك — لا تنطبق آليات النقل بموجب المادة 46 من GDPR. للمهنيين في الاتحاد الأوروبي الذين يتعاملون مع بيانات شخصية، هذا هو البديل الحافظ للخصوصية مقابل واجهات API للذكاء الاصطناعي السحابي. أول نموذج محلي لديك (llama3.2:3b) يستخدم 2 GB من القرص، ويولّد صفر استدعاءات API خارجية، ويمتثل بالتصميم لإرشادات تقليل البيانات.
الخليج (PDPL السعودي): تتطلب أطر حوكمة البيانات في الخليج توثيق مكان حدوث استدلال الذكاء الاصطناعي. ينشئ أول إعداد لـ Ollama بيئة محلية كاملة وقابلة للتدقيق: ملفات نموذج مخزّنة في ~/.ollama/models بأسماء ملفات خاصة بالإصدار، دون اعتماد على API خارجي، واستدلال يمكن التحقق منه عبر `ollama ps`. يمكن للمهنيين في الخليج الذين يشغّلون Llama أو Qwen3 محليًا توثيق إصدار النموذج الدقيق والأجهزة لأغراض الامتثال. كما تتوفر بدائل عربية سيادية مثل Jais وALLaM للمؤسسات التي تفضّل نماذج عربية المنشأ.
الصين: لسير العمل بالصينية، استبدل llama3.2:3b بـ qwen2.5:3b كأول نموذج: `ollama pull qwen2.5:3b`. يعالج Qwen3 النص الصيني بكفاءة أعلى بـ 30-40% في الـ tokens من Llama، فينتج نتائج أفضل على مستوى الأجهزة نفسه. أمرا ollama pull وrun متطابقان.
الأسئلة الشائعة عند تشغيل أول نموذج LLM محلي
استجابة النموذج بطيئة جدًا — هل هذا طبيعي؟
على أجهزة CPU فقط، 8-20 token/ثانية أمر طبيعي لنموذج 7B. كل token يعادل نحو 0.75 كلمة. بـ 10 token/ثانية، تستغرق استجابة من 100 كلمة نحو 13 ثانية. لتسريع الاستدلال، استخدم نموذجًا أصغر (3B بدلًا من 8B)، أو فعّل التفريغ إلى بطاقة الرسوم إن كان لديك متوافقة، أو استخدم مستوى تكميم Q4_K_M وهو الإعداد الأسرع المعتاد.
هل يمكنني تشغيل نموذجين في آن واحد؟
يمكن لـ Ollama إبقاء عدة نماذج محمّلة في آن واحد إذا كان لديك RAM كافٍ. افتراضيًا، يفرّغ Ollama نموذجًا بعد 5 دقائق من الخمول. يمكنك تغيير ذلك بمتغير البيئة OLLAMA_KEEP_ALIVE. تشغيل نموذجي 7B في آن واحد يتطلب ~16 GB من RAM.
كيف أوقف Ollama عن العمل في الخلفية؟
على macOS: انقر على أيقونة اللاما في شريط القوائم واختر إنهاء. على Linux: نفّذ `systemctl stop ollama`. على Windows: انقر بزر الفأرة الأيمن على أيقونة شريط النظام واختر إنهاء. لمنع Ollama من البدء عند تسجيل الدخول، أزله من عناصر بدء التشغيل لديك.
ما أسهل طريقة لتشغيل نموذج LLM محلي لأول مرة؟
ثبّت Ollama (ollama.com)، ونفّذ `ollama pull llama3.2:3b` ثم `ollama run llama3.2:3b`. هذا كل شيء. ثلاثة أوامر، 2-5 دقائق، ولديك نموذج ذكاء اصطناعي يعمل على جهازك دون حاجة إلى الإنترنت بعد التنزيل الأولي.
كيف أعرف أن نموذج LLM المحلي يعمل بشكل صحيح؟
نفّذ `ollama ps` في الطرفية. إذا كان النموذج قيد التشغيل، سيظهر في القائمة باسمه وحجمه واستخدام ذاكرته. أرسل له أمرًا بسيطًا مثل "كم يساوي 2+2؟" — إذا أجاب "4"، فالنموذج يعمل بشكل صحيح.
هل يحتاج حاسوبي إلى بطاقة رسوم لتشغيل نموذج LLM محلي؟
لا. تعمل نماذج LLM المحلية على CPU. بطاقة الرسوم تجعل الاستدلال أسرع بـ 5-10 مرات، لكن CPU وحده مناسب للتعلّم ولكثير من حالات الاستخدام الفعلية. يمكن للحواسيب المحمولة الحديثة بـ Apple M1/M2 أو AMD Ryzen أو Intel من الجيل الثاني عشر تشغيل نماذج 3B-7B بسرعات معقولة (10-30 token/ثانية).
كم مساحة قرص يشغل نموذج LLM محلي؟
`llama3.2:1b` يشغل 1.3 GB، و`llama3.2:3b` يشغل 2 GB، و`llama3.1:8b` يشغل 4.7 GB. هذه الأحجام المضغوطة كما يخزّنها Ollama. بعد تحميلها في RAM للاستدلال، تختلف الأحجام (راجع كم من VRAM لنموذج LLM محلي للمزيد من التفاصيل).
هل يمكنني استخدام نموذج LLM المحلي دون اتصال بالإنترنت؟
نعم، بالكامل. نزّل النموذج مرة واحدة بـ Ollama (يتطلب إنترنت) ثم شغّله محليًا للأبد دون إنترنت. مثالي للشبكات الخاصة أو الطائرات أو البيئات المعزولة تمامًا.
بماذا يختلف نموذج LLM المحلي عن ChatGPT؟
يعمل ChatGPT على خوادم Anthropic. وتعمل نماذج LLM المحلية على جهازك. محلي = صفر بيانات تغادر جهازك، خصوصية كاملة، بلا تكاليف API. ChatGPT = جودة أفضل في المهام المعقدة، يتطلب إنترنت واشتراكًا مدفوعًا. لكليهما مزايا وعيوب.
ما أفضل نموذج أول لتجربته مع Ollama؟
`ollama pull llama3.2:3b` — يزن 2 GB، يعمل على أي حاسوب محمول حديث، ينتج استجابات كفؤة، وهو نقطة البداية الموصى بها من Ollama. بعد تجربته، راجع أفضل نماذج LLM المحلية للمبتدئين للبدائل حسب أجهزتك.
الخطوات التالية بعد أول تشغيل
الآن وقد صار لديك نموذج LLM محلي يعمل، استكشف ما يمكنه فعله. لفهم أي النماذج تؤدي أفضل مع أجهزتك، راجع أفضل نماذج LLM المحلية للمبتدئين. لنصائح أداء خاصة بالحواسيب المحمولة، راجع كيفية تشغيل نماذج LLM المحلية على حاسوب محمول. لأفضل ممارسات الخصوصية والأمان، راجع قائمة التحقق لأمان وخصوصية نموذج LLM المحلي.
المصادر
- **مكتبة نماذج Ollama** -- القائمة الرسمية للنماذج القابلة للتنزيل ومواصفاتها
- **مستودع Ollama على GitHub** -- الكود مفتوح المصدر والتوثيق وتتبّع المشكلات
- **بطاقة نموذج Meta Llama 3.2** -- المواصفات الرسمية وبيانات التدريب ومعايير الأداء
الأخطاء الشائعة بعد أول تشغيل
- الخلط بين عدد الـ tokens والسرعة — نموذج 7B يولّد 100 token بـ 20 token/ثانية يستغرق 5 ثوانٍ، وليس فوريًا.
- تشغيل الاستدلال بينما النظام مشغول بمهام أخرى، مما يقلّل tokens/ثانية الفعلية بشكل كبير.
- عدم التحقق من حدود نافذة السياق — تدعم معظم نماذج المبتدئين 2K-8K token، لا 100K+ كنماذج الطليعة.
- توقّع استجابات فورية في أول تشغيل — تتضمن الاستجابة الأولى وقت تحميل النموذج (5-30 ثانية). الاستجابات اللاحقة في الجلسة نفسها أسرع بـ 2-5 مرات.
- استخدام وسم النموذج الخاطئ — `llama3.1:8b-text` هو وضع إكمال النص الأساسي وسينتج حلقات/تكرارًا لا نهائيًا. استخدم وسوم `-instruct` مثل `llama3.1:8b-instruct` للدردشة.