Key Takeaways
- يعمل اليوم — لكن نماذج صغيرة فقط. iPhone يشغّل 1–3B، Android 3–7B، iPad يتعامل مع 13B.
- توقّع 3–15 tok/ث — مفيد للمحادثة والأسئلة، لا لتوليد نص طويل.
- أفضل تهيئة: iPad Pro M4 + PocketPal AI أو MLC Chat. أفضل هاتف: Android Snapdragon X Elite.
- لماذا تستخدمه؟ المحادثة دون اتصال، الملاحظات الخاصة، صفر تكاليف API، بلا حاجة للإنترنت.
- تجنّبه إذا: كنت تحتاج سرعة سطح المكتب أو نماذج 70B أو زمن استجابة فوريًا أقل من 500 مللي ثانية.
حقائق سريعة
- iPhone 16 Pro (A18 Pro): 3–4 tok/ث على نماذج 3B، 12 GB RAM مشتركة، عملي للأسئلة والملخصات
- iPad Pro M4: 15 tok/ث على نماذج 7B، يشغّل نماذج 13B، 16 GB ذاكرة موحدة — أفضل جهاز Apple محمول لـ LLM
- Android Snapdragon X Elite: 5 tok/ث على نماذج 7B، 8–12 GB RAM، أفضل خيار Android للاستدلال المحلي
- فجوة عرض نطاق الذاكرة: iPhone A18 ~68 GB/ث مقابل RTX 4090 1,008 GB/ث — تفسّر فرق السرعة بمقدار 15–50×
- استهلاك البطارية: ينفد iPhone خلال 2–4 ساعات مع استدلال متواصل؛ iPad يدوم 4–6 ساعات
ما الذي يعمل فعلًا على الهاتف (2026)
iPhone (A18/A18 Pro): يشغّل نماذج 1–3B فقط. Llama 3.2 1B وPhi-4 Mini 3.8B هما الخياران العمليان. السرعة: 3–4 tok/ث. مفيد للأسئلة السريعة والملخصات القصيرة والاستعلامات دون اتصال. غير مناسب للمحادثات الطويلة أو توليد الشيفرة.
Android (Snapdragon X Elite): يشغّل نماذج 3–7B. Llama 3.2 7B وMistral Small يعملان بسرعة 5 tok/ث. Galaxy S25 Ultra وأجهزة Snapdragon المتطورة هي أفضل خيارات Android. عملي للمحادثة والملخصات والمساعدين دون اتصال.
iPad Pro (M4): الجهاز المحمول الوحيد حيث تبدو نماذج LLM المحلية قابلة للاستخدام فعلًا. يشغّل نماذج 7–13B بسرعة 15 tok/ث مع 16 GB ذاكرة موحدة. يتعامل مع Llama 3.2 7B بأريحية ويمكنه تشغيل نماذج 13B بجودة قريبة من GPT-4o mini.
ما الذي لا يعمل: نماذج 70B على أي جهاز محمول. نماذج 7B على iPhone (تسبب إغلاقات غير متوقعة). أي نموذج على هواتف بأقل من 8 GB RAM. مساعدون صوتيون فوريون (زمن الاستجابة عالٍ جدًا).
أي عتاد للهواتف يشغّل نماذج LLM المحلية في 2026؟
iPhone 16 Pro (A18 Pro) هو الحد الأدنى العملي من iPhone لنماذج LLM المحلية — 12 GB RAM مشتركة تشغّل Llama 3.2 3B بسرعة 4 tok/ث. iPhone 16 القياسي (8 GB) يتعامل مع نماذج 1B فقط.
| الجهاز | أقصى حجم نموذج | السرعة | الذاكرة |
|---|---|---|---|
| iPhone 16 (A18) | 3B | 3 tok/ث | مشتركة 8 GB |
| iPhone 16 Pro (A18 Pro) | 3B | 4 tok/ث | مشتركة 12 GB |
| Android (Snapdragon X Elite) | 7B | 5 tok/ث | 8–12 GB |
| Pixel 9 Pro (Tensor G4) | 3B | 3 tok/ث | 16 GB |
| Samsung Galaxy S25 Ultra | 7B | 4 tok/ث | 12 GB |
| iPad Pro (M4) | 13B | 15 tok/ث | مشتركة 16 GB |
يشغّل Pixel 9 Pro نموذج Gemini Nano أصليًا عبر API AICore من Google — الوصول غير متاح لتطبيقات الطرف الثالث بعد. يقدّم Samsung Galaxy S25 Ultra نظام Samsung Galaxy AI (هجين على الجهاز + سحابة) — استدلال محلي بحت عبر MLC Chat أو LLaMa Lite.
أفضل التهيئات الحالية: التطبيقات وأطر العمل
| التطبيق | المنصة | النماذج المدعومة | السعر |
|---|---|---|---|
| PocketPal AI | iOS، Android | 1–3B GGUF | مجاني |
| MLC Chat | iOS، Android | 1–7B | مجاني (مفتوح المصدر) |
| Ollama iOS | iPhone، iPad | 1–3B | مجاني |
| Layla | iOS | 1–3B + RAG | مجاني + Pro |
| Chatlize | iOS، Android | 1–3B | مجاني + Pro |
| Private LLM | iOS (iPad Apple Silicon) | 3–13B | 5.99 دولار (دفعة واحدة) |
| LLaMa Lite | Android | 3–7B | مجاني |
| MLC LLM (dev) | Android | 1–7B عبر MLC | مجاني (للمطورين) |
PocketPal AI (أُطلق في يناير 2025) هو الآن أكثر تطبيقات LLM المحلية للهواتف شيوعًا بأكثر من 500,000 تنزيل على iOS وAndroid (أبريل 2026). يقدّم MLC Chat من MLC-AI أوسع دعم للنماذج (Llama، Qwen، Gemma، Phi) بواجهات متطابقة على iOS وAndroid.
أي أطر عمل تدعم تطوير LLM للهواتف؟
iOS: Core ML وMetal Performance Shaders يديران تحسين النماذج. llama.cpp يوفّر محرك الاستدلال الأساسي لمعظم تطبيقات LLM على iOS.
Android: TensorFlow Lite وONNX Runtime وSnapdragon Neural Processing Engine. يقدّم MLC LLM استدلالًا للهواتف متعدد المنصات.
يمكن للمطورين تحويل نماذج Llama وQwen وMistral إلى صيغ GGUF أو Core ML محسّنة للهواتف باستخدام llama.cpp أو coremltools.
MLC LLM مقابل Ollama: مقارنة الاستدلال المحلي على أندرويد
يتفوق MLC LLM في الاستدلال المحلي على أندرويد. Ollama ليس حلاً أصلياً لأندرويد. يعمل Ollama كخادم على سطح المكتب/macOS/Linux — تصل إليه من أندرويد عبر تطبيق عميل بشبكة Wi-Fi. يقوم MLC LLM (عبر تطبيق MLC Chat) بتجميع النماذج إلى كود أصلي للجهاز باستخدام TVM، مما يجعله الإطار الرئيسي الوحيد الذي يوفر استدلالاً حقيقياً على جهاز أندرويد — يعمل النموذج بالكامل على هاتفك دون أي اتصال بالشبكة.
لماذا يتفوق MLC LLM على Ollama في أندرويد: يستخدم MLC Chat نظام TVM (الآلة الافتراضية الموترية) لتجميع النماذج إلى شيدرات Vulkan أو OpenCL محسّنة لكل شريحة GPU أندرويد. يستخدم Ollama مكتبة llama.cpp المصممة للاستدلال بالمعالج/وحدة الرسومات على سطح المكتب — دون تحسين Vulkan أو حزم أندرويد. النتيجة: يحقق MLC Chat سرعة 5 رمز/ثانية على نموذج Llama 3.2 7B في Snapdragon X Elite، بينما يعتمد أداء Ollama على أندرويد على خادم سطح المكتب المتصل به.
| العامل | MLC LLM (MLC Chat) | Ollama على أندرويد |
|---|---|---|
| تطبيق أندرويد أصلي | نعم — Play Store | لا — خادم فقط |
| استدلال حقيقي على الجهاز | نعم — دون اتصال بالإنترنت | لا — يتطلب خادم سطح المكتب |
| محرك الاستدلال | TVM (Vulkan/OpenCL) | llama.cpp عبر الخادم |
| النماذج المدعومة | Llama وQwen وGemma وPhi | جميع GGUF (عبر سطح المكتب) |
| السرعة على Snapdragon X Elite | 5 رمز/ثانية (7B) | تعتمد على الشبكة |
| يعمل بدون Wi-Fi | نعم | لا (يحتاج خادم) |
| دعم iOS | نعم (App Store) | عبر تطبيق Ollama iOS فقط |
MLC Chat مقابل PocketPal AI: كلاهما تطبيقات أندرويد تعمل بالكامل على الجهاز. يستخدم MLC Chat نماذج مُجمَّعة بـTVM (أسرع على معالجات Snapdragon، تسريع Vulkan)، بينما يستخدم PocketPal AI صيغة GGUF (توافق أوسع مع النماذج، تنزيل مباشر من HuggingFace). على أندرويد Snapdragon X، يتفوق MLC Chat في السرعة. يتفوق PocketPal AI في تنوع النماذج وسهولة التنزيل.
الهاتف مقابل الحاسوب المحمول مقابل الحاسوب الصغير: أيها تستخدم؟
الهواتف المحمولة هي الخيار الأضعف لنماذج LLM المحلية — لكنها الوحيد الذي يتسع في الجيب. إليك كيف تُقارَن بالحواسيب المحمولة والصغيرة للذكاء الاصطناعي على الجهاز:
| العامل | الهاتف | الحاسوب المحمول (M4 Pro) | الحاسوب الصغير (M4 Pro) |
|---|---|---|---|
| أقصى حجم نموذج | 3–7B | 70B | 70B |
| السرعة (7B) | 3–5 tok/ث | 30–40 tok/ث | 35–45 tok/ث |
| RAM المتاحة | 6–12 GB قابلة للاستخدام | 24–48 GB | 24–64 GB |
| قابلية الحمل | جيب | حقيبة | مكتبي فقط |
| البطارية (استدلال) | 2–5 ساعات | 6–10 ساعات | موصول بالكهرباء |
| التكلفة | 0 دولار (هاتف موجود) | 1,999 دولارًا+ | 799 دولارًا+ |
| مثالي لـ | أسئلة سريعة دون اتصال | عمل تطوير محمول | خادم دائم التشغيل |
لمعظم المستخدمين: استخدم هاتفك للاستعلامات السريعة دون اتصال، وحاسوبًا محمولًا للعمل الجاد، وحاسوبًا صغيرًا كخادم LLM محلي يمكن الوصول إليه من جميع الأجهزة عبر Wi-Fi.
ما مدى سرعة نماذج LLM للهواتف مقابل سطح المكتب؟
الهاتف أبطأ بمقدار 15–50× من سطح المكتب بسبب عرض نطاق الذاكرة. يملك iPhone A18 عرض نطاق ~68 GB/ث؛ بينما RTX 4090 لها 1,008 GB/ث. تتناسب سرعة استدلال LLM طرديًا مع عرض نطاق الذاكرة.
| الجهاز | النموذج | tokens/ث |
|---|---|---|
| سطح مكتب RTX 4090 | Llama 7B | 150 tok/ث |
| iPad M4 | Llama 7B | 15 tok/ث |
| Android (Snapdragon X) | Llama 7B | 5 tok/ث |
| iPhone 16 Pro | Llama 3B | 4 tok/ث |
اعتبارات إقليمية
دول الخليج (PDPL السعودي وقانون حماية البيانات الإماراتي): يُعد الاستدلال على الجهاز عاملًا أساسيًا لنماذج LLM المحلية على الهواتف — فهو يبقي البيانات الشخصية على هاتف المستخدم دون نقل عابر للحدود. تتطلب سياسات إدارة الأجهزة المؤسسية في دول الخليج بشكل متزايد ذكاءً اصطناعيًا على الجهاز لتطبيقات الصحة والقانون.
السيادة الرقمية: تفضّل متطلبات حماية البيانات الإقليمية الاستدلال على الجهاز لتطبيقات الأعمال للهواتف. تدعم نماذج عربية سيادية مثل Jais وALLaM وFalcon المعالجة المحلية للمحتوى العربي.
المحتوى العربي: تشغّل نماذج LLM المحلية للهواتف نماذج عربية محسّنة دون إرسال البيانات لخوادم خارجية. تدعم شرائح متطورة مثل Snapdragon X Elite الاستدلال على الجهاز للنماذج العربية.
القطاعات الحساسة: توفّر نماذج LLM المحلية بالعربية خصوصية للبيانات دون الاعتماد على خوادم خارجية، وهو أمر مهم للقطاعات القانونية والطبية والتعليمية حيث تكون السرية أولوية.
أفضل حالات الاستخدام لنماذج LLM للهواتف
نماذج LLM للهواتف ليست بديلًا لذكاء سطح المكتب الاصطناعي. تتفوق في سيناريوهات محددة حيث تهم القدرة على العمل دون اتصال أو الخصوصية أو التكلفة الصفرية أكثر من السرعة أو الجودة.
- مساعد محادثة دون اتصال — أسئلة وأجوبة في الطائرات، المترو، المناطق الريفية بلا إنترنت. Llama 3.2 1B على iPhone يتعامل مع الأسئلة البسيطة بسرعة 3 tok/ث.
- ملاحظات خاصة — لخّص ملاحظات الاجتماعات، أعد صياغة المسودات، ولّد أفكارًا دون إرسال بيانات لأي خادم. متوافق مع لوائح حماية البيانات بحكم التصميم.
- مساعدة برمجية خفيفة — Phi-4 Mini 3.8B على iPad يوفّر إكمالًا وشرحًا للشيفرة بمستوى مقبول لـ Python وJavaScript وSQL.
- تعلّم اللغات — تدرّب على المحادثات بأي لغة دون اتصال. تتعامل نماذج 1–3B بشكل جيد مع الحوار الأساسي.
- العمل الميداني — يمكن للمهنيين الصحيين والمفتشين الميدانيين والمحامين الاستعلام عن المستندات محليًا دون اتصال سحابي أو مخاوف بشأن نقل البيانات.
- يوميات شخصية — تأمّل مدعوم بالذكاء الاصطناعي ومحفّزات كتابة بخصوصية تامة — لا شيء يغادر جهازك.
قيود يجب أن تعرفها
- قيود RAM: iPhone بـ "12 GB RAM" لا يتوفر منه سوى 6–8 GB للـ LLM بعد استخدام نظام iOS. أغلق Safari وMail والتطبيقات في الخلفية قبل تحميل نموذج. نموذج بحجم 4 GB على هاتف بـ 12 GB قد يتعطّل تحت ضغط الذاكرة.
- استهلاك البطارية: الاستدلال المتواصل يستنزف iPhone خلال 2–4 ساعات، وiPad خلال 4–6 ساعات. حدّد طول الاستجابة بـ 200 token كحد أقصى. لا تشغّل الاستدلال أثناء الشحن — الخفض الحراري يقلّل السرعة بنسبة 30–50%.
- الخفض الحراري: تخفّض الهواتف CPU/GPU بعد 5–10 دقائق من الاستدلال المتواصل. تنخفض السرعة بنسبة 20–40% مع تسخّن الجهاز. خذ استراحات بين الجلسات الطويلة.
- جودة النموذج: نماذج 1–3B أسوأ بشكل ملحوظ من GPT-5.5 أو Claude. توقّع أخطاء واقعية ونوافذ سياق أقصر (2K–4K token عمليًا) واستدلالًا أضعف. مفيد للمسودات، لا للنتائج النهائية.
- لا 7B على iPhone: الحد الأقصى العملي على أي iPhone هو 3B. محاولة استخدام 7B تسبب إغلاقات غير متوقعة أو سرعة بمعدل دقائق لكل استجابة. إذا احتجت 7B، استخدم Android Snapdragon X Elite أو iPad.
- واقع الذاكرة المشتركة: تشترك الأجهزة المحمولة في RAM بين النظام والتطبيقات والـ LLM — لا تحصل أبدًا على كامل RAM المعلن عنها للاستدلال.
متى ستصبح نماذج LLM للهواتف عملية؟
أواخر 2027 هي نقطة التحول. ستنقل Apple A19 Pro وSnapdragon X2 نماذج 7–13B إلى الهواتف بسرعة 15–25 tok/ث — سريع بما يكفي للمحادثة الفورية. حتى ذلك الحين، نماذج LLM للهواتف أداة متخصصة لحالات استخدام محددة.
هواتف 2027: نماذج 7–13B بسرعة 15–25 tok/ث. عملي لمعظم مهام المحادثة والأسئلة. لا 70B بعد.
هواتف 2028+: يُتوقع نماذج 13–24B. جودة تقترب من مستوى GPT-4o mini على الجهاز. تظل قيود البطارية والحرارة عنق الزجاجة.
أفضل خيار اليوم: استخدم هاتفك للاستعلامات السريعة دون اتصال وشغّل Mac mini M4 Pro أو GPU سطح مكتب كخادم محلي يمكن الوصول إليه من هاتفك عبر Wi-Fi. هذا يمنحك راحة الهاتف باستدلال بجودة سطح المكتب.
الأسئلة الشائعة
هل يمكنني تشغيل نموذج LLM محلي على iPhone؟
نعم، لكن نماذج صغيرة فقط (1–3B معامل). iPhone 16 بشريحة A18 يشغّل Llama 3.2 1B بسرعة ~3 tokens/ث. Llama 3.2 3B يعمل بسرعة ~2 tokens/ث. النماذج الأكبر من 3B تسبب إغلاقات أو تتطلب دقائق لكل استجابة. للاستخدام العملي، يدعم Ollama iOS وChatlize نماذج 1–3B على iPhone.
أي أجهزة Android يمكنها تشغيل نماذج LLM المحلية؟
أجهزة Android بمعالجات Snapdragon X Elite أو Snapdragon X Plus يمكنها تشغيل نماذج 7B بسرعة ~5 tokens/ث. أجهزة Android المتوسطة القياسية (Snapdragon 8 Gen 3) تتعامل مع نماذج 3B بسرعة ~3 tokens/ث. الأجهزة بأقل من 8 GB RAM غير عملية لأي استدلال LLM محلي.
كيف يُقارَن iPad بـ iPhone لنماذج LLM المحلية؟
iPad Pro M4 يتفوق بشكل ملحوظ على iPhone لنماذج LLM المحلية: 15 tokens/ث على Llama 3.2 7B مقابل 3–4 tokens/ث على iPhone 16 Pro. شريحة M4 في iPad تتعامل أيضًا مع نماذج 13B بأريحية (16 GB ذاكرة موحدة)، وهو ما لا يمكن لـ iPhone تشغيله إطلاقًا. لعمل الذكاء الاصطناعي المحمول، iPad هو جهاز Apple الموصى به.
ما أفضل تطبيق لتشغيل نماذج LLM على الهاتف؟
PocketPal AI هو الأكثر شيوعًا (500K+ تنزيل، iOS + Android). يقدّم MLC Chat أوسع دعم للنماذج (Llama، Qwen، Gemma، Phi). لـ iOS تحديدًا: Ollama iOS أو Layla. لـ Android: LLaMa Lite أو MLC Chat. جميعها مجانية.
لماذا استدلال LLM للهواتف بطيء جدًا مقارنة بسطح المكتب؟
عرض نطاق الذاكرة. iPhone A18 له ~68 GB/ث؛ RTX 4090 لها 1,008 GB/ث — أكثر بنحو 15×. تتناسب سرعة استدلال LLM مع عرض نطاق الذاكرة. يتفوق الهاتف في الكفاءة (1–5 واط مقابل 300–600 واط)، لا في الأداء.
هل يستهلك استدلال LLM المحلي على الهاتف الكثير من البطارية؟
نعم — الاستدلال المتواصل بكامل الحمل يستنزف بطارية iPhone خلال 2–4 ساعات. اضبط حدودًا لطول الاستجابة (200 token كحد أقصى) لتقليل الاستهلاك. iPad M4 يدوم 4–6 ساعات تحت حمل الاستدلال. أجهزة Apple Silicon أكثر كفاءة بشكل ملحوظ من Snapdragon X للاستدلال المتواصل.
هل يمكنني استخدام Gemini Nano لنموذج LLM محلي على Pixel؟
نعم، لكن بشكل غير مباشر. Gemini Nano هو نموذج Google على الجهاز الذي يعمل أصليًا على Pixel 9 Pro عبر API AICore. اعتبارًا من أبريل 2026، لا يمكن لتطبيقات الطرف الثالث استدعاء Gemini Nano مباشرة — فهو يشغّل وظائف النظام (Magic Compose، ملخصات Recorder). لنموذج LLM محلي يتحكم به المستخدم على Pixel، ثبّت PocketPal AI أو MLC Chat وحمّل Llama 3.2 3B أو Phi-4 Mini.
هل ستشغّل هواتف 2027 نماذج 70B محليًا؟
لا. تشير خرائط الطريق الحالية (Apple A19 Pro، Snapdragon X2، Tensor G5) إلى أن هواتف 2027 ستتعامل مع نماذج 7–13B بسرعة 15–25 tok/ث — لا 70B. تحدّ قيود عرض نطاق الذاكرة والحرارة من الحجم العملي لنماذج الهواتف. لاستدلال 70B بصيغة محمولة، يبقى iPad Pro M6 أو حاسوب صغير محلي كخادم الخيار العملي لـ 2027.
MLC LLM مقابل Ollama: أيهما أفضل للاستدلال المحلي على أندرويد؟
MLC LLM (عبر MLC Chat) أفضل للاستدلال المحلي على أندرويد. Ollama ليس تطبيقاً أصلياً لأندرويد — يعمل كخادم على سطح المكتب ويتطلب من هاتفك الاتصال عبر Wi-Fi. يجمّع MLC Chat النماذج بـTVM إلى شيدرات Vulkan لوحدات GPU أندرويد، مقدماً استدلالاً حقيقياً دون اتصال بالإنترنت بسرعة 5 رمز/ثانية على Snapdragon X Elite لنماذج 7B. استخدم MLC Chat للاستدلال المحلي على أندرويد دون اتصال. استخدم Ollama إذا كنت تشغّله على خادم سطح المكتب وتصل إليه عن بُعد من أندرويد.
ما هي أفضل بدائل PocketPal AI لأندرويد؟
أفضل بدائل PocketPal AI لأندرويد: MLC Chat (نماذج مُجمَّعة بـTVM، أسرع على Snapdragon X Elite، تسريع Vulkan)، LLaMa Lite (خفيف، أندرويد فقط، GGUF 3–7B)، وChatlize (iOS وأندرويد، مجاني). على iOS: Ollama iOS وLayla (مع RAG) وPrivate LLM (5.99 دولار، الأفضل لـiPad M4). جميعها تعمل على الجهاز دون إنترنت.
MLC Chat مقابل PocketPal AI: أيهما أختار؟
اختر MLC Chat للحصول على استدلال أسرع على Snapdragon X Android (شيدرات Vulkan المُجمَّعة بـTVM، 5 رمز/ثانية لـ7B) ودعم Llama وQwen وGemma وPhi في تطبيق واحد. اختر PocketPal AI لتوافق أوسع مع نماذج GGUF وتنزيلات أسهل من HuggingFace أو نفس التطبيق على iPhone وiPad وأندرويد. كلاهما مجاني ويعمل بالكامل دون اتصال بالإنترنت.
المصادر
- مواصفات شريحة Apple A18 — المواصفات الرسمية لعتاد iPhone 16، بما في ذلك Neural Engine وعرض نطاق الذاكرة
- منصة Qualcomm Snapdragon X Elite — قدرات استدلال الذكاء الاصطناعي لأجهزة Android وWindows
- Ollama iOS (SwiftUI) — عميل iOS مفتوح المصدر لتشغيل نماذج LLM المحلية على iPhone وiPad
- TensorFlow Lite — إطار عمل Google للاستدلال في تعلّم الآلة على الجهاز
- نماذج الهواتف أصغر ولها قيود تتجاوز حدود العتاد. حتى أكبر نماذج الهواتف لها فجوات استدلال جوهرية: ما الذي لا تستطيع نماذج LLM فعله يشرح هذه الحدود.