Skip to main content
PromptQuorumPromptQuorum
Home/Local LLMs/نماذج ⁨LLM⁩ المحلية على الهواتف ⁨2026⁩: ⁨iPhone 16 Pro⁩ و⁨iPad M4⁩ و⁨Snapdragon X⁩
Hardware & Performance

نماذج ⁨LLM⁩ المحلية على الهواتف ⁨2026⁩: ⁨iPhone 16 Pro⁩ و⁨iPad M4⁩ و⁨Snapdragon X⁩

·10 دقائق قراءة·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

يمكنك تشغيل نماذج LLM محلية على هاتفك: 1–3B على iPhone (3 tok/ث)، 7B على Snapdragon X Android (5 tok/ث)، 13B على iPad M4 (15 tok/ث). بطيء لكنه عملي للمحادثة دون اتصال والملاحظات الخاصة والذكاء الاصطناعي الخفيف بلا تكاليف API.

نعم، يمكنك تشغيل نموذج LLM محلي على هاتفك في 2026، لكن نماذج صغيرة فقط (1–3B على iPhone، حتى 7B على Android المتطور). توقّع 3–5 tok/ث، لا 80–150 tok/ث التي تحصل عليها على سطح المكتب. تستحق المقايضة العناء للمحادثة دون اتصال والملاحظات الخاصة ومهام الذكاء الاصطناعي الخفيفة بلا تكاليف API ولا إنترنت. يغطي هذا الدليل أفضل تطبيقات LLM للهواتف (PocketPal AI، MLC Chat، Ollama iOS)، ودروس الإعداد لـ Android وiOS، وأي عتاد يشغّلها فعلًا.

العرض التقديمي: نماذج ⁨LLM⁩ المحلية على الهواتف ⁨2026⁩: ⁨iPhone 16 Pro⁩ و⁨iPad M4⁩ و⁨Snapdragon X⁩

عرض تفاعلي من 12 شريحة: نماذج LLM المحلية على الهاتف مع iPhone A18 (3B بسرعة 3 tok/ث)، Snapdragon X Elite (7B بسرعة 5 tok/ث)، iPad Pro M4 (13B بسرعة 15 tok/ث). مقارنة عتاد 6 أجهزة، 8 تطبيقات LLM للهواتف (PocketPal AI، MLC Chat، Ollama iOS)، اختبارات السرعة مقابل سطح المكتب، Gemini Nano على Pixel وأخطاء شائعة. نزّل ملف PDF كبطاقة مرجعية لـ LLM للهواتف.

تصفّح الشرائح أدناه أو نزّلها بصيغة PDF للرجوع إليها دون اتصال. تنزيل البطاقة المرجعية (PDF)

Key Takeaways

  • يعمل اليوم — لكن نماذج صغيرة فقط. iPhone يشغّل 1–3B، Android 3–7B، iPad يتعامل مع 13B.
  • توقّع 3–15 tok/ث — مفيد للمحادثة والأسئلة، لا لتوليد نص طويل.
  • أفضل تهيئة: iPad Pro M4 + PocketPal AI أو MLC Chat. أفضل هاتف: Android Snapdragon X Elite.
  • لماذا تستخدمه؟ المحادثة دون اتصال، الملاحظات الخاصة، صفر تكاليف API، بلا حاجة للإنترنت.
  • تجنّبه إذا: كنت تحتاج سرعة سطح المكتب أو نماذج 70B أو زمن استجابة فوريًا أقل من 500 مللي ثانية.

حقائق سريعة

  • iPhone 16 Pro (A18 Pro): 3–4 tok/ث على نماذج 3B، 12 GB RAM مشتركة، عملي للأسئلة والملخصات
  • iPad Pro M4: 15 tok/ث على نماذج 7B، يشغّل نماذج 13B، 16 GB ذاكرة موحدة — أفضل جهاز Apple محمول لـ LLM
  • Android Snapdragon X Elite: 5 tok/ث على نماذج 7B، 8–12 GB RAM، أفضل خيار Android للاستدلال المحلي
  • فجوة عرض نطاق الذاكرة: iPhone A18 ~68 GB/ث مقابل RTX 4090 1,008 GB/ث — تفسّر فرق السرعة بمقدار 15–50×
  • استهلاك البطارية: ينفد iPhone خلال 2–4 ساعات مع استدلال متواصل؛ iPad يدوم 4–6 ساعات

ما الذي يعمل فعلًا على الهاتف (2026)

iPhone (A18/A18 Pro): يشغّل نماذج 1–3B فقط. Llama 3.2 1B وPhi-4 Mini 3.8B هما الخياران العمليان. السرعة: 3–4 tok/ث. مفيد للأسئلة السريعة والملخصات القصيرة والاستعلامات دون اتصال. غير مناسب للمحادثات الطويلة أو توليد الشيفرة.

Android (Snapdragon X Elite): يشغّل نماذج 3–7B. Llama 3.2 7B وMistral Small يعملان بسرعة 5 tok/ث. Galaxy S25 Ultra وأجهزة Snapdragon المتطورة هي أفضل خيارات Android. عملي للمحادثة والملخصات والمساعدين دون اتصال.

iPad Pro (M4): الجهاز المحمول الوحيد حيث تبدو نماذج LLM المحلية قابلة للاستخدام فعلًا. يشغّل نماذج 7–13B بسرعة 15 tok/ث مع 16 GB ذاكرة موحدة. يتعامل مع Llama 3.2 7B بأريحية ويمكنه تشغيل نماذج 13B بجودة قريبة من GPT-4o mini.

ما الذي لا يعمل: نماذج 70B على أي جهاز محمول. نماذج 7B على iPhone (تسبب إغلاقات غير متوقعة). أي نموذج على هواتف بأقل من 8 GB RAM. مساعدون صوتيون فوريون (زمن الاستجابة عالٍ جدًا).

أي عتاد للهواتف يشغّل نماذج LLM المحلية في 2026؟

iPhone 16 Pro (A18 Pro) هو الحد الأدنى العملي من iPhone لنماذج LLM المحلية — 12 GB RAM مشتركة تشغّل Llama 3.2 3B بسرعة 4 tok/ث. iPhone 16 القياسي (8 GB) يتعامل مع نماذج 1B فقط.

الجهازأقصى حجم نموذجالسرعةالذاكرة
iPhone 16 (A18)3B3 tok/ثمشتركة 8 GB
iPhone 16 Pro (A18 Pro)3B4 tok/ثمشتركة 12 GB
Android (Snapdragon X Elite)7B5 tok/ث8–12 GB
Pixel 9 Pro (Tensor G4)3B3 tok/ث16 GB
Samsung Galaxy S25 Ultra7B4 tok/ث12 GB
iPad Pro (M4)13B15 tok/ثمشتركة 16 GB

يشغّل Pixel 9 Pro نموذج Gemini Nano أصليًا عبر API AICore من Google — الوصول غير متاح لتطبيقات الطرف الثالث بعد. يقدّم Samsung Galaxy S25 Ultra نظام Samsung Galaxy AI (هجين على الجهاز + سحابة) — استدلال محلي بحت عبر MLC Chat أو LLaMa Lite.

مقارنة عتاد الهواتف لـ LLM: iPad Pro M4 يتصدر بسرعة 15 tok/ث على نماذج 13B، Snapdragon X Elite يشغّل 7B بسرعة 5 tok/ث، iPhone 16 Pro يتعامل مع 3B بسرعة 4 tok/ث.
مقارنة عتاد الهواتف لـ LLM: iPad Pro M4 يتصدر بسرعة 15 tok/ث على نماذج 13B، Snapdragon X Elite يشغّل 7B بسرعة 5 tok/ث، iPhone 16 Pro يتعامل مع 3B بسرعة 4 tok/ث.

أفضل التهيئات الحالية: التطبيقات وأطر العمل

التطبيقالمنصةالنماذج المدعومةالسعر
PocketPal AIiOS، Android1–3B GGUFمجاني
MLC ChatiOS، Android1–7Bمجاني (مفتوح المصدر)
Ollama iOSiPhone، iPad1–3Bمجاني
LaylaiOS1–3B + RAGمجاني + Pro
ChatlizeiOS، Android1–3Bمجاني + Pro
Private LLMiOS (iPad Apple Silicon)3–13B5.99 دولار (دفعة واحدة)
LLaMa LiteAndroid3–7Bمجاني
MLC LLM (dev)Android1–7B عبر MLCمجاني (للمطورين)

PocketPal AI (أُطلق في يناير 2025) هو الآن أكثر تطبيقات LLM المحلية للهواتف شيوعًا بأكثر من 500,000 تنزيل على iOS وAndroid (أبريل 2026). يقدّم MLC Chat من MLC-AI أوسع دعم للنماذج (Llama، Qwen، Gemma، Phi) بواجهات متطابقة على iOS وAndroid.

أفضل 5 تطبيقات LLM للهواتف: PocketPal AI (500K+ تنزيل، iOS + Android)، MLC Chat (أوسع دعم، 1–7B)، Ollama iOS، Private LLM (5.99 دولار، 3–13B على iPad)، LLaMa Lite (Android).
أفضل 5 تطبيقات LLM للهواتف: PocketPal AI (500K+ تنزيل، iOS + Android)، MLC Chat (أوسع دعم، 1–7B)، Ollama iOS، Private LLM (5.99 دولار، 3–13B على iPad)، LLaMa Lite (Android).

أي أطر عمل تدعم تطوير LLM للهواتف؟

iOS: Core ML وMetal Performance Shaders يديران تحسين النماذج. llama.cpp يوفّر محرك الاستدلال الأساسي لمعظم تطبيقات LLM على iOS.

Android: TensorFlow Lite وONNX Runtime وSnapdragon Neural Processing Engine. يقدّم MLC LLM استدلالًا للهواتف متعدد المنصات.

يمكن للمطورين تحويل نماذج Llama وQwen وMistral إلى صيغ GGUF أو Core ML محسّنة للهواتف باستخدام llama.cpp أو coremltools.

MLC LLM مقابل Ollama: مقارنة الاستدلال المحلي على أندرويد

يتفوق MLC LLM في الاستدلال المحلي على أندرويد. Ollama ليس حلاً أصلياً لأندرويد. يعمل Ollama كخادم على سطح المكتب/macOS/Linux — تصل إليه من أندرويد عبر تطبيق عميل بشبكة Wi-Fi. يقوم MLC LLM (عبر تطبيق MLC Chat) بتجميع النماذج إلى كود أصلي للجهاز باستخدام TVM، مما يجعله الإطار الرئيسي الوحيد الذي يوفر استدلالاً حقيقياً على جهاز أندرويد — يعمل النموذج بالكامل على هاتفك دون أي اتصال بالشبكة.

لماذا يتفوق MLC LLM على Ollama في أندرويد: يستخدم MLC Chat نظام TVM (الآلة الافتراضية الموترية) لتجميع النماذج إلى شيدرات Vulkan أو OpenCL محسّنة لكل شريحة GPU أندرويد. يستخدم Ollama مكتبة llama.cpp المصممة للاستدلال بالمعالج/وحدة الرسومات على سطح المكتب — دون تحسين Vulkan أو حزم أندرويد. النتيجة: يحقق MLC Chat سرعة 5 رمز/ثانية على نموذج Llama 3.2 7B في Snapdragon X Elite، بينما يعتمد أداء Ollama على أندرويد على خادم سطح المكتب المتصل به.

العاملMLC LLM (MLC Chat)Ollama على أندرويد
تطبيق أندرويد أصلينعم — Play Storeلا — خادم فقط
استدلال حقيقي على الجهازنعم — دون اتصال بالإنترنتلا — يتطلب خادم سطح المكتب
محرك الاستدلالTVM (Vulkan/OpenCL)llama.cpp عبر الخادم
النماذج المدعومةLlama وQwen وGemma وPhiجميع GGUF (عبر سطح المكتب)
السرعة على Snapdragon X Elite5 رمز/ثانية (7B)تعتمد على الشبكة
يعمل بدون Wi-Fiنعملا (يحتاج خادم)
دعم iOSنعم (App Store)عبر تطبيق Ollama iOS فقط

MLC Chat مقابل PocketPal AI: كلاهما تطبيقات أندرويد تعمل بالكامل على الجهاز. يستخدم MLC Chat نماذج مُجمَّعة بـTVM (أسرع على معالجات Snapdragon، تسريع Vulkan)، بينما يستخدم PocketPal AI صيغة GGUF (توافق أوسع مع النماذج، تنزيل مباشر من HuggingFace). على أندرويد Snapdragon X، يتفوق MLC Chat في السرعة. يتفوق PocketPal AI في تنوع النماذج وسهولة التنزيل.

الهاتف مقابل الحاسوب المحمول مقابل الحاسوب الصغير: أيها تستخدم؟

الهواتف المحمولة هي الخيار الأضعف لنماذج LLM المحلية — لكنها الوحيد الذي يتسع في الجيب. إليك كيف تُقارَن بالحواسيب المحمولة والصغيرة للذكاء الاصطناعي على الجهاز:

العاملالهاتفالحاسوب المحمول (M4 Pro)الحاسوب الصغير (M4 Pro)
أقصى حجم نموذج3–7B70B70B
السرعة (7B)3–5 tok/ث30–40 tok/ث35–45 tok/ث
RAM المتاحة6–12 GB قابلة للاستخدام24–48 GB24–64 GB
قابلية الحملجيبحقيبةمكتبي فقط
البطارية (استدلال)2–5 ساعات6–10 ساعاتموصول بالكهرباء
التكلفة0 دولار (هاتف موجود)1,999 دولارًا+799 دولارًا+
مثالي لـأسئلة سريعة دون اتصالعمل تطوير محمولخادم دائم التشغيل

لمعظم المستخدمين: استخدم هاتفك للاستعلامات السريعة دون اتصال، وحاسوبًا محمولًا للعمل الجاد، وحاسوبًا صغيرًا كخادم LLM محلي يمكن الوصول إليه من جميع الأجهزة عبر Wi-Fi.

ما مدى سرعة نماذج LLM للهواتف مقابل سطح المكتب؟

الهاتف أبطأ بمقدار 15–50× من سطح المكتب بسبب عرض نطاق الذاكرة. يملك iPhone A18 عرض نطاق ~68 GB/ث؛ بينما RTX 4090 لها 1,008 GB/ث. تتناسب سرعة استدلال LLM طرديًا مع عرض نطاق الذاكرة.

الجهازالنموذجtokens/ث
سطح مكتب RTX 4090Llama 7B150 tok/ث
iPad M4Llama 7B15 tok/ث
Android (Snapdragon X)Llama 7B5 tok/ث
iPhone 16 ProLlama 3B4 tok/ث
سرعة LLM للهواتف مقابل سطح المكتب: RTX 4090 بسرعة 150 tok/ث أسرع بمقدار 10× من iPad M4 (15 tok/ث) وأسرع بمقدار 37× من iPhone 16 Pro (4 tok/ث).
سرعة LLM للهواتف مقابل سطح المكتب: RTX 4090 بسرعة 150 tok/ث أسرع بمقدار 10× من iPad M4 (15 tok/ث) وأسرع بمقدار 37× من iPhone 16 Pro (4 tok/ث).

اعتبارات إقليمية

دول الخليج (PDPL السعودي وقانون حماية البيانات الإماراتي): يُعد الاستدلال على الجهاز عاملًا أساسيًا لنماذج LLM المحلية على الهواتف — فهو يبقي البيانات الشخصية على هاتف المستخدم دون نقل عابر للحدود. تتطلب سياسات إدارة الأجهزة المؤسسية في دول الخليج بشكل متزايد ذكاءً اصطناعيًا على الجهاز لتطبيقات الصحة والقانون.

السيادة الرقمية: تفضّل متطلبات حماية البيانات الإقليمية الاستدلال على الجهاز لتطبيقات الأعمال للهواتف. تدعم نماذج عربية سيادية مثل Jais وALLaM وFalcon المعالجة المحلية للمحتوى العربي.

المحتوى العربي: تشغّل نماذج LLM المحلية للهواتف نماذج عربية محسّنة دون إرسال البيانات لخوادم خارجية. تدعم شرائح متطورة مثل Snapdragon X Elite الاستدلال على الجهاز للنماذج العربية.

القطاعات الحساسة: توفّر نماذج LLM المحلية بالعربية خصوصية للبيانات دون الاعتماد على خوادم خارجية، وهو أمر مهم للقطاعات القانونية والطبية والتعليمية حيث تكون السرية أولوية.

فجوة عرض نطاق الذاكرة: iPhone A18 بسرعة 68 GB/ث مقابل RTX 4090 بسرعة 1,008 GB/ث — فرق بمقدار 15× يفسّر مباشرةً لماذا تكون نماذج LLM للهواتف أبطأ بمقدار 15–50× من سطح المكتب.
فجوة عرض نطاق الذاكرة: iPhone A18 بسرعة 68 GB/ث مقابل RTX 4090 بسرعة 1,008 GB/ث — فرق بمقدار 15× يفسّر مباشرةً لماذا تكون نماذج LLM للهواتف أبطأ بمقدار 15–50× من سطح المكتب.

أفضل حالات الاستخدام لنماذج LLM للهواتف

نماذج LLM للهواتف ليست بديلًا لذكاء سطح المكتب الاصطناعي. تتفوق في سيناريوهات محددة حيث تهم القدرة على العمل دون اتصال أو الخصوصية أو التكلفة الصفرية أكثر من السرعة أو الجودة.

  • مساعد محادثة دون اتصال — أسئلة وأجوبة في الطائرات، المترو، المناطق الريفية بلا إنترنت. Llama 3.2 1B على iPhone يتعامل مع الأسئلة البسيطة بسرعة 3 tok/ث.
  • ملاحظات خاصة — لخّص ملاحظات الاجتماعات، أعد صياغة المسودات، ولّد أفكارًا دون إرسال بيانات لأي خادم. متوافق مع لوائح حماية البيانات بحكم التصميم.
  • مساعدة برمجية خفيفة — Phi-4 Mini 3.8B على iPad يوفّر إكمالًا وشرحًا للشيفرة بمستوى مقبول لـ Python وJavaScript وSQL.
  • تعلّم اللغات — تدرّب على المحادثات بأي لغة دون اتصال. تتعامل نماذج 1–3B بشكل جيد مع الحوار الأساسي.
  • العمل الميداني — يمكن للمهنيين الصحيين والمفتشين الميدانيين والمحامين الاستعلام عن المستندات محليًا دون اتصال سحابي أو مخاوف بشأن نقل البيانات.
  • يوميات شخصية — تأمّل مدعوم بالذكاء الاصطناعي ومحفّزات كتابة بخصوصية تامة — لا شيء يغادر جهازك.

قيود يجب أن تعرفها

  • قيود RAM: iPhone بـ "12 GB RAM" لا يتوفر منه سوى 6–8 GB للـ LLM بعد استخدام نظام iOS. أغلق Safari وMail والتطبيقات في الخلفية قبل تحميل نموذج. نموذج بحجم 4 GB على هاتف بـ 12 GB قد يتعطّل تحت ضغط الذاكرة.
  • استهلاك البطارية: الاستدلال المتواصل يستنزف iPhone خلال 2–4 ساعات، وiPad خلال 4–6 ساعات. حدّد طول الاستجابة بـ 200 token كحد أقصى. لا تشغّل الاستدلال أثناء الشحن — الخفض الحراري يقلّل السرعة بنسبة 30–50%.
  • الخفض الحراري: تخفّض الهواتف CPU/GPU بعد 5–10 دقائق من الاستدلال المتواصل. تنخفض السرعة بنسبة 20–40% مع تسخّن الجهاز. خذ استراحات بين الجلسات الطويلة.
  • جودة النموذج: نماذج 1–3B أسوأ بشكل ملحوظ من GPT-5.5 أو Claude. توقّع أخطاء واقعية ونوافذ سياق أقصر (2K–4K token عمليًا) واستدلالًا أضعف. مفيد للمسودات، لا للنتائج النهائية.
  • لا 7B على iPhone: الحد الأقصى العملي على أي iPhone هو 3B. محاولة استخدام 7B تسبب إغلاقات غير متوقعة أو سرعة بمعدل دقائق لكل استجابة. إذا احتجت 7B، استخدم Android Snapdragon X Elite أو iPad.
  • واقع الذاكرة المشتركة: تشترك الأجهزة المحمولة في RAM بين النظام والتطبيقات والـ LLM — لا تحصل أبدًا على كامل RAM المعلن عنها للاستدلال.
مدة البطارية تحت استدلال LLM: iPad Pro M4 يدوم 5 ساعات، Galaxy S25 Ultra 3.5 ساعات، iPhone 16 Pro 3 ساعات، iPhone 16 ساعتان فقط من الاستدلال المتواصل.
مدة البطارية تحت استدلال LLM: iPad Pro M4 يدوم 5 ساعات، Galaxy S25 Ultra 3.5 ساعات، iPhone 16 Pro 3 ساعات، iPhone 16 ساعتان فقط من الاستدلال المتواصل.

متى ستصبح نماذج LLM للهواتف عملية؟

أواخر 2027 هي نقطة التحول. ستنقل Apple A19 Pro وSnapdragon X2 نماذج 7–13B إلى الهواتف بسرعة 15–25 tok/ث — سريع بما يكفي للمحادثة الفورية. حتى ذلك الحين، نماذج LLM للهواتف أداة متخصصة لحالات استخدام محددة.

هواتف 2027: نماذج 7–13B بسرعة 15–25 tok/ث. عملي لمعظم مهام المحادثة والأسئلة. لا 70B بعد.

هواتف 2028+: يُتوقع نماذج 13–24B. جودة تقترب من مستوى GPT-4o mini على الجهاز. تظل قيود البطارية والحرارة عنق الزجاجة.

أفضل خيار اليوم: استخدم هاتفك للاستعلامات السريعة دون اتصال وشغّل Mac mini M4 Pro أو GPU سطح مكتب كخادم محلي يمكن الوصول إليه من هاتفك عبر Wi-Fi. هذا يمنحك راحة الهاتف باستدلال بجودة سطح المكتب.

الأسئلة الشائعة

هل يمكنني تشغيل نموذج LLM محلي على iPhone؟

نعم، لكن نماذج صغيرة فقط (1–3B معامل). iPhone 16 بشريحة A18 يشغّل Llama 3.2 1B بسرعة ~3 tokens/ث. Llama 3.2 3B يعمل بسرعة ~2 tokens/ث. النماذج الأكبر من 3B تسبب إغلاقات أو تتطلب دقائق لكل استجابة. للاستخدام العملي، يدعم Ollama iOS وChatlize نماذج 1–3B على iPhone.

أي أجهزة Android يمكنها تشغيل نماذج LLM المحلية؟

أجهزة Android بمعالجات Snapdragon X Elite أو Snapdragon X Plus يمكنها تشغيل نماذج 7B بسرعة ~5 tokens/ث. أجهزة Android المتوسطة القياسية (Snapdragon 8 Gen 3) تتعامل مع نماذج 3B بسرعة ~3 tokens/ث. الأجهزة بأقل من 8 GB RAM غير عملية لأي استدلال LLM محلي.

كيف يُقارَن iPad بـ iPhone لنماذج LLM المحلية؟

iPad Pro M4 يتفوق بشكل ملحوظ على iPhone لنماذج LLM المحلية: 15 tokens/ث على Llama 3.2 7B مقابل 3–4 tokens/ث على iPhone 16 Pro. شريحة M4 في iPad تتعامل أيضًا مع نماذج 13B بأريحية (16 GB ذاكرة موحدة)، وهو ما لا يمكن لـ iPhone تشغيله إطلاقًا. لعمل الذكاء الاصطناعي المحمول، iPad هو جهاز Apple الموصى به.

ما أفضل تطبيق لتشغيل نماذج LLM على الهاتف؟

PocketPal AI هو الأكثر شيوعًا (500K+ تنزيل، iOS + Android). يقدّم MLC Chat أوسع دعم للنماذج (Llama، Qwen، Gemma، Phi). لـ iOS تحديدًا: Ollama iOS أو Layla. لـ Android: LLaMa Lite أو MLC Chat. جميعها مجانية.

لماذا استدلال LLM للهواتف بطيء جدًا مقارنة بسطح المكتب؟

عرض نطاق الذاكرة. iPhone A18 له ~68 GB/ث؛ RTX 4090 لها 1,008 GB/ث — أكثر بنحو 15×. تتناسب سرعة استدلال LLM مع عرض نطاق الذاكرة. يتفوق الهاتف في الكفاءة (1–5 واط مقابل 300–600 واط)، لا في الأداء.

هل يستهلك استدلال LLM المحلي على الهاتف الكثير من البطارية؟

نعم — الاستدلال المتواصل بكامل الحمل يستنزف بطارية iPhone خلال 2–4 ساعات. اضبط حدودًا لطول الاستجابة (200 token كحد أقصى) لتقليل الاستهلاك. iPad M4 يدوم 4–6 ساعات تحت حمل الاستدلال. أجهزة Apple Silicon أكثر كفاءة بشكل ملحوظ من Snapdragon X للاستدلال المتواصل.

هل يمكنني استخدام Gemini Nano لنموذج LLM محلي على Pixel؟

نعم، لكن بشكل غير مباشر. Gemini Nano هو نموذج Google على الجهاز الذي يعمل أصليًا على Pixel 9 Pro عبر API AICore. اعتبارًا من أبريل 2026، لا يمكن لتطبيقات الطرف الثالث استدعاء Gemini Nano مباشرة — فهو يشغّل وظائف النظام (Magic Compose، ملخصات Recorder). لنموذج LLM محلي يتحكم به المستخدم على Pixel، ثبّت PocketPal AI أو MLC Chat وحمّل Llama 3.2 3B أو Phi-4 Mini.

هل ستشغّل هواتف 2027 نماذج 70B محليًا؟

لا. تشير خرائط الطريق الحالية (Apple A19 Pro، Snapdragon X2، Tensor G5) إلى أن هواتف 2027 ستتعامل مع نماذج 7–13B بسرعة 15–25 tok/ث — لا 70B. تحدّ قيود عرض نطاق الذاكرة والحرارة من الحجم العملي لنماذج الهواتف. لاستدلال 70B بصيغة محمولة، يبقى iPad Pro M6 أو حاسوب صغير محلي كخادم الخيار العملي لـ 2027.

MLC LLM مقابل Ollama: أيهما أفضل للاستدلال المحلي على أندرويد؟

MLC LLM (عبر MLC Chat) أفضل للاستدلال المحلي على أندرويد. Ollama ليس تطبيقاً أصلياً لأندرويد — يعمل كخادم على سطح المكتب ويتطلب من هاتفك الاتصال عبر Wi-Fi. يجمّع MLC Chat النماذج بـTVM إلى شيدرات Vulkan لوحدات GPU أندرويد، مقدماً استدلالاً حقيقياً دون اتصال بالإنترنت بسرعة 5 رمز/ثانية على Snapdragon X Elite لنماذج 7B. استخدم MLC Chat للاستدلال المحلي على أندرويد دون اتصال. استخدم Ollama إذا كنت تشغّله على خادم سطح المكتب وتصل إليه عن بُعد من أندرويد.

ما هي أفضل بدائل PocketPal AI لأندرويد؟

أفضل بدائل PocketPal AI لأندرويد: MLC Chat (نماذج مُجمَّعة بـTVM، أسرع على Snapdragon X Elite، تسريع Vulkan)، LLaMa Lite (خفيف، أندرويد فقط، GGUF 3–7B)، وChatlize (iOS وأندرويد، مجاني). على iOS: Ollama iOS وLayla (مع RAG) وPrivate LLM (5.99 دولار، الأفضل لـiPad M4). جميعها تعمل على الجهاز دون إنترنت.

MLC Chat مقابل PocketPal AI: أيهما أختار؟

اختر MLC Chat للحصول على استدلال أسرع على Snapdragon X Android (شيدرات Vulkan المُجمَّعة بـTVM، 5 رمز/ثانية لـ7B) ودعم Llama وQwen وGemma وPhi في تطبيق واحد. اختر PocketPal AI لتوافق أوسع مع نماذج GGUF وتنزيلات أسهل من HuggingFace أو نفس التطبيق على iPhone وiPad وأندرويد. كلاهما مجاني ويعمل بالكامل دون اتصال بالإنترنت.

المصادر

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text. This article reflects publicly available information as of May 2026.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Join the PromptQuorum Waitlist →

← Back to Local LLMs