Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Meilleures applications LLM locales pour iPhone en 2026 (IA sans WiFi)
Mobile & Edge LLMs

Meilleures applications LLM locales pour iPhone en 2026 (IA sans WiFi)

·12 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Pour la plupart des utilisateurs iPhone en 2026, installez PocketPal AI depuis l'App Store et téléchargez Phi-4 Mini (3,8B Q4_K_M, ~2,7 Go). Gratuit, open source, compatible avec iPhone 14 Pro et les modèles plus récents (tout iPhone avec 6 Go+ de RAM), il génère ~10–15 tokens/sec sur iPhone 16 Pro pour un usage quotidien. Pour l'intégration Siri et Shortcuts, Private LLM est la meilleure option payante (5,99 € en achat unique, couvre iPhone, iPad et Mac). Locally AI — désormais développé par l'équipe LM Studio — est l'alternative gratuite moderne basée sur Apple MLX, avec support Shortcuts et accès au modèle de fondation on-device d'Apple. MLC Chat reste l'application de référence pour Metal mais n'a pas été mise à jour depuis fin 2024. LLM Farm a été retiré de l'App Store en août 2025 et ne s'installe désormais qu'en compilant les sources. Apple Intelligence exécute également des modèles on-device mais est intégré au système — il complète ces applications plutôt qu'il ne les remplace.

Cinq applications iPhone font tourner de vrais LLM entièrement sur l'appareil en 2026 : PocketPal AI, Private LLM, Locally AI (par LM Studio), MLC Chat et Apple Intelligence (intégrée au système). Toutes fonctionnent sans WiFi une fois le modèle téléchargé. Ce guide les classe selon les tokens par seconde sur iPhone 16 Pro et iPhone 17 Pro, la bibliothèque de modèles, la gestion de la RAM, la posture de confidentialité et l'intégration iOS — et explique pourquoi LLM Farm est sorti du classement.

Meilleures applications LLM locales pour iPhone en 2026 (IA sans WiFi)

Points clés

  • PocketPal AI est la meilleure option gratuite par défaut. Open source, disponible sur l'App Store, compatible avec n'importe quel modèle GGUF depuis Hugging Face. Fait tourner Phi-4 Mini à ~10–15 tokens/sec sur iPhone 16 Pro. Point de départ recommandé pour la plupart des utilisateurs.
  • Private LLM est la meilleure option payante (5,99 €, sans abonnement). Un seul achat couvre iPhone, iPad et Mac avec le partage familial. Bibliothèque de modèles sélectionnés, intégration iOS Shortcuts et commande vocale Siri "Dis Siri, demande à Private LLM".
  • Locally AI est l'alternative gratuite basée sur MLX, désormais développée par l'équipe LM Studio. Fait tourner des modèles Llama, Gemma, Qwen et DeepSeek sur Apple MLX, fonctionne avec iOS Shortcuts et peut exposer le propre modèle de fondation on-device d'Apple comme interface de chat.
  • MLC Chat est accéléré par Metal mais inactif. Son moteur MLC LLM génère toujours ~25–35 % de tokens/sec de plus que les applications basées sur llama.cpp sur le même matériel, mais l'application n'a pas été mise à jour depuis fin 2024, si bien que sa bibliothèque de modèles précède Phi-4 Mini et Gemma 3.
  • LLM Farm a été retiré de l'App Store en août 2025. Son propre README le décrit comme "temporairement indisponible". Il reste open source et compilable depuis les sources, et demeure l'option la plus configurable (mirostat, modèles de chat) pour les développeurs.
  • Apple Intelligence est on-device mais pas une application distincte. Le modèle de fondation ~3B d'Apple alimente des fonctionnalités système (Outils d'écriture, Réponse intelligente, Résumés de notifications). Depuis iOS 26, les applications tierces peuvent l'appeler via le framework Foundation Models, et Shortcuts peut l'interroger via l'action "Utiliser le modèle".
  • Modèle recommandé pour iPhone 16 Pro / 17 Pro : Phi-4 Mini (3,8B Q4_K_M, ~2,7 Go). Meilleur équilibre qualité/vitesse pour le niveau 8 Go+ de RAM. Anciens iPhone avec 6 Go de RAM (iPhone 14 Pro) : Qwen3 1.7B ou SmolLM 2 1.7B.

Données rapides

  • Applications comparées : PocketPal AI, Private LLM, Locally AI (par LM Studio), MLC Chat, Apple Intelligence (système) — ainsi que LLM Farm, retiré de l'App Store en août 2025.
  • Appareils de test : iPhone 16 Pro (A18 Pro, 8 Go de RAM) et iPhone 17 Pro (A19 Pro, 12 Go de RAM).
  • Moteurs d'inférence : llama.cpp (PocketPal AI, LLM Farm), Apple MLX (Locally AI), MLC LLM avec Metal (MLC Chat), runtime on-device propriétaire (Private LLM, Apple Intelligence).
  • iPhone minimum pour les modèles 3B+ : iPhone 14 Pro (A16, 6 Go de RAM) pour 1,7B ; tout iPhone 8 Go+ (15 Pro, série 16, 16e, série 17) pour 3B–4B.
  • Meilleure application gratuite : PocketPal AI — App Store, open source, flexibilité des modèles.
  • Meilleure application payante : Private LLM — 5,99 € en achat unique (iPhone + iPad + Mac), support Shortcuts + Siri.
  • Hors ligne : Les cinq fonctionnent entièrement hors ligne une fois le modèle téléchargé ; aucun appel cloud.

Quelle application iPhone installer en premier ?

Pour la plupart des utilisateurs : PocketPal AI depuis l'App Store, puis téléchargez Phi-4 Mini (3,8B Q4_K_M). Cette combinaison fonctionne sur iPhone 14 Pro et les modèles plus récents, ne coûte rien et produit des résultats utilisables pour le chat quotidien, la synthèse et la rédaction rapide. Choisissez une autre application uniquement si vous avez un besoin spécifique qu'elle ne couvre pas.

📍 En une phrase

Pour la plupart des utilisateurs iPhone en 2026, installez PocketPal AI (gratuit, App Store) et téléchargez Phi-4 Mini — il couvre le chat quotidien, la synthèse et la rédaction sur tout iPhone avec 6 Go+ de RAM.

💬 En termes simples

Cinq applications font tourner l'IA entièrement sur votre iPhone en 2026. PocketPal AI est le meilleur point de départ gratuit — installez-le, téléchargez un fichier modèle de 2,7 Go une seule fois, et vous disposez d'un assistant de chat privé qui fonctionne dans le train sans WiFi. Private LLM est l'option payante si vous souhaitez que Siri parle au modèle local. Locally AI, de l'équipe LM Studio, est l'alternative gratuite moderne avec support Shortcuts. MLC Chat est rapide mais n'est plus mis à jour. Apple Intelligence est intégré à iOS mais n'est pas une application de chat. PocketPal AI couvre 90 % des cas d'usage.

Décision : quelle application IA locale pour iPhone ?

Utilisez un LLM local si :

  • Vous souhaitez un assistant IA gratuit fonctionnant hors ligne → PocketPal AI
  • Vous souhaitez que Siri parle à votre modèle local → Private LLM
  • Vous souhaitez une app MLX gratuite avec Shortcuts et accès aux Apple Foundation Models → Locally AI
  • Vous acceptez une bibliothèque de modèles plus ancienne pour une vitesse Metal maximale → MLC Chat
  • Vous n'avez besoin que d'aide à la rédaction dans Mail / Messages / Notes → Apple Intelligence (intégré)

Utilisez un modèle cloud si :

  • Vous avez besoin de la qualité d'un modèle 70B+ (Llama 3.3 70B, niveau GPT-5.5) → utilisez le cloud ou connectez-vous à distance à une machine domestique
  • Vous avez besoin d'accès à GPT-5.5, Claude Opus ou Gemini spécifiquement → applications cloud (non disponibles en local)
  • Vous avez besoin de vision en temps réel ou de sorties multimodales au-delà du texte → cloud (le multimodal on-device est limité en 2026)

Décision rapide :

  • Gratuit + couvre 90 % des cas : PocketPal AI
  • Payant + intégration native iOS : Private LLM
  • Gratuit + écosystème LM Studio : Locally AI
Quelle app IA locale pour iPhone : PocketPal AI (défaut gratuit), Private LLM (Siri + Raccourcis), Locally AI (MLX gratuit, équipe LM Studio), MLC Chat (rapide sur Metal mais inactif), Apple Intelligence (intégré à iOS).
Quelle app IA locale pour iPhone : PocketPal AI (défaut gratuit), Private LLM (Siri + Raccourcis), Locally AI (MLX gratuit, équipe LM Studio), MLC Chat (rapide sur Metal mais inactif), Apple Intelligence (intégré à iOS).

💡Astuce: Installez PocketPal AI en premier, même si vous envisagez de payer Private LLM plus tard. Utilisez PocketPal AI pour tester si l'inférence on-device sur votre iPhone est suffisamment rapide pour votre usage. Si oui, décidez si l'intégration iOS Shortcuts et Siri de Private LLM vaut 5,99 €. Si non, vous avez économisé 5,99 € en le découvrant avant de payer.

Tableau comparatif des applications iPhone

Les cinq applications se différencient sur trois axes importants pour la plupart des utilisateurs : le coût, la flexibilité des modèles et l'intégration avec iOS. Les différences de vitesse existent mais sont moins importantes que l'écart entre n'importe laquelle de ces applications et un LLM cloud.

📍 En une phrase

PocketPal AI est la meilleure option gratuite par défaut, Private LLM est la meilleure option payante, Locally AI est le choix MLX gratuit de l'équipe LM Studio, MLC Chat est rapide sur Metal mais inactif, Apple Intelligence est intégré au système.

💬 En termes simples

Le choix se résume généralement à trois critères : souhaitez-vous payer pour l'intégration Siri (Private LLM), voulez-vous l'écosystème LM Studio avec Shortcuts gratuitement (Locally AI), ou voulez-vous la vitesse brute maximale en acceptant une bibliothèque de modèles plus ancienne (MLC Chat) ? Pour tout le reste, PocketPal AI est le choix par défaut. Les chiffres du tableau supposent une quantisation Q4_K_M — le standard pour l'inférence mobile en 2026.

Application
Prix
Tokens/sec (Phi-4 Mini, 16 Pro)
Confidentialité
Idéal pour
PocketPal AIGratuit (open source)~10–15Local uniquement, sans télémétrieOption gratuite par défaut pour la plupart
Private LLM5,99 € achat unique~10–14Local uniquement, analyses opt-iniOS Shortcuts + intégration Siri
Locally AIGratuit (équipe LM Studio)N/A — catalogue MLX (pas de Phi-4)Local uniquement, sans collecte de donnéesMLX + Shortcuts, lien LM Studio
MLC ChatGratuit (open source)N/A — bibliothèque antérieure à Phi-4Local uniquement, sans télémétrieVitesse Metal, modèles anciens
LLM FarmGratuit (sources uniquement)~10–15Local uniquement, sans télémétrieUtilisateurs avancés (retiré de l'App Store)
Apple IntelligenceGratuit (intégré à iOS)N/A (fonctionnalité système)Local + Private Cloud Compute opt-inAssistance Mail, Messages, Notes

Note sur Apple Neural Engine (ANE), Metal et MLX : PocketPal AI et LLM Farm utilisent llama.cpp avec Metal Performance Shaders pour l'inférence, qui s'exécute sur le GPU. MLC Chat utilise MLC LLM avec une optimisation Metal plus poussée, atteignant 25–35 % de tokens/sec de plus sur le même matériel pour les modèles qu'il prend en charge. Locally AI utilise Apple MLX, le framework de calcul open source d'Apple, atteignant une efficacité GPU comparable sur Apple Silicon. Apple Intelligence utilise l'ANE spécifiquement pour le modèle système ~3B, plus économe en énergie mais moins flexible que l'inférence basée sur Metal. Depuis iOS 26, les applications tierces peuvent appeler ce modèle système via le framework Foundation Models — c'est exactement ce que fait Locally AI —, mais les modèles GGUF/MLX personnalisés ne peuvent toujours pas cibler directement l'ANE.

Comparatif apps LLM locaux iPhone : PocketPal AI (gratuit, ~10–15 tok/s), Locally AI (gratuit, Apple MLX + Shortcuts), MLC Chat (gratuit, ~14–20 tok/s, Metal, inactif depuis fin 2024), Private LLM (5,99 € unique, Siri + Raccourcis), Apple Intelligence (système).
Comparatif apps LLM locaux iPhone : PocketPal AI (gratuit, ~10–15 tok/s), Locally AI (gratuit, Apple MLX + Shortcuts), MLC Chat (gratuit, ~14–20 tok/s, Metal, inactif depuis fin 2024), Private LLM (5,99 € unique, Siri + Raccourcis), Apple Intelligence (système).

💡Astuce: Les chiffres de tokens/sec supposent une quantisation Q4_K_M (le standard pour l'inférence mobile en 2026) et un iPhone inactif sans autre application lourde en cours. Les applications en arrière-plan réduisent le débit de 10–30 %. Les tokens/sec sur iPhone 17 Pro sont environ 20–30 % plus élevés que sur iPhone 16 Pro grâce aux améliorations de l'A19 Pro.

PocketPal AI : option gratuite open source

PocketPal AI est le point de départ recommandé pour la plupart des utilisateurs iPhone en 2026. Gratuit, open source (GitHub : a-ghorbani/pocketpal-ai), disponible sur l'App Store et compatible avec n'importe quel modèle GGUF depuis Hugging Face. L'application utilise llama.cpp en coulisses avec des optimisations Apple Silicon.

  • Qu'est-ce que c'est : une application iOS qui exécute des modèles GGUF en local avec llama.cpp. Sans abonnement, sans télémétrie, sans compte requis.
  • Installation : App Store → "PocketPal AI". Téléchargement gratuit.
  • Ajouter un modèle : dans l'application, appuyez sur Modèles → "Ajouter depuis Hugging Face" → recherchez (ex. "phi-4-mini-instruct-Q4_K_M") → appuyez pour télécharger. Le modèle est stocké dans l'espace de stockage local de l'application (~2,7 Go pour Phi-4 Mini Q4).
  • Vitesse de génération (iPhone 16 Pro) : Phi-4 Mini ~10–15 tok/sec, Llama 3.2 3B ~12–18 tok/sec, Gemma 3 4B ~7–10 tok/sec, Qwen3 1.7B ~18–24 tok/sec.
  • Idéal pour : les utilisateurs souhaitant une application de chat gratuite, installable depuis l'App Store, sans compte, compatible avec tout modèle GGUF communautaire.

💡Astuce: Le sélecteur de modèles de PocketPal AI dispose d'un filtre "Recommandés" affichant les modèles vérifiés comme tenant dans la RAM de votre appareil. Pour un iPhone 16 Pro (8 Go de RAM), le sélecteur recommande des variantes Q4_K_M de modèles jusqu'à ~4B paramètres. Faites confiance à ce filtre — l'utilisation d'un modèle trop grand entraîne l'arrêt de l'application par iOS en cours de réponse.

Private LLM : option payante avec intégration iOS

Private LLM est la meilleure option iPhone payante en 2026 (5,99 €, sans abonnement). Disponible uniquement sur l'App Store, il est livré avec une bibliothèque de modèles optimisés sélectionnés. Sa différenciation réside dans l'intégration iOS : actions Shortcuts et commande vocale "Dis Siri, demande à Private LLM".

  • Qu'est-ce que c'est : une application iOS payante avec une bibliothèque de modèles sélectionnés et une intégration iOS poussée. Utilise un runtime on-device propriétaire optimisé pour Apple Silicon.
  • Installation : App Store → "Private LLM". Achat unique 5,99 € (sans abonnement).
  • Bibliothèque de modèles sélectionnés : ~30 modèles pré-testés et optimisés pour iPhone, dont Llama 3.2 3B, Phi-4 Mini, Mistral Small Instruct et plusieurs variantes non censurées. Moins de flexibilité que PocketPal AI mais aucun risque d'installer un modèle qui plante.
  • iOS Shortcuts : Private LLM expose une action "Générer du texte avec Private LLM" que vous pouvez enchaîner dans des automatisations Shortcuts. Utile pour déclencher l'IA locale depuis un bouton sur votre écran d'accueil ou via des étiquettes NFC.
  • Intégration Siri : "Dis Siri, demande à Private LLM [votre question]" achemine l'invite vers le modèle on-device et lit la réponse à voix haute. Fonctionne sans connexion internet. La latence est plus élevée que dans l'interface de chat (~3–5 secondes avant le démarrage de l'audio).

💡Astuce: Private LLM est un achat universel : le prix unique de 5,99 € couvre iPhone, iPad et Mac en un seul achat, et le partage familial Apple l'étend jusqu'à six membres de la famille. Sans abonnement ni achat intégré — le prix affiché est le coût total.

Locally AI : application MLX gratuite de LM Studio

Locally AI est une application de chat gratuite et axée confidentialité, désormais développée par l'équipe LM Studio, construite sur le framework Apple MLX plutôt que sur llama.cpp. C'est l'entrant sérieux le plus récent de cette catégorie et la seule application ici à exposer le modèle de fondation on-device d'Apple comme interface de chat.

  • Qu'est-ce que c'est : une application iOS/iPadOS/macOS utilisant Apple MLX pour l'inférence, développée par l'équipe derrière l'application de bureau LM Studio.
  • Installation : App Store → "Locally AI". Gratuit, aucun compte requis, 100 % hors ligne.
  • Bibliothèque de modèles : Llama 3.2, Gemma 2/3/4, Qwen 3, DeepSeek, LFM 2.5, Bonsai, Ministral 3 et Apple Foundation Models — un catalogue plus large et plus récent que celui de MLC Chat.
  • iOS Shortcuts : expose une action Shortcuts, à égalité avec le support d'automatisation de Private LLM mais gratuitement.
  • LM Link : une fonctionnalité optionnelle qui se connecte à LM Studio exécuté sur un Mac via une liaison chiffrée de bout en bout, permettant à l'application iPhone de basculer vers un modèle plus grand sur une machine domestique si nécessaire.
  • Prérequis : iOS/iPadOS 18.1+ (les gains d'efficacité d'Apple Silicon sont les plus marqués à partir d'iPhone 15 Pro).

💡Astuce: Locally AI est la seule application de ce guide capable de placer le propre modèle de fondation on-device d'Apple derrière une fenêtre de chat classique — utile pour tester ce que le modèle d'Apple Intelligence peut faire sans naviguer dans les menus des Outils d'écriture. Pour la flexibilité GGUF tierce, PocketPal AI conserve le plus grand catalogue de modèles.

MLC Chat : optimisé pour Apple Silicon

MLC Chat (du projet MLC LLM) reste l'application de référence pour l'accélération Metal, mais elle n'a pas été mise à jour depuis fin 2024. Gratuit, open source, il exécute des modèles compilés par la chaîne d'outils MLC LLM plutôt que des GGUF standard — cette exigence de compilation explique aussi pourquoi son catalogue n'a pas suivi le rythme de PocketPal AI ou de Locally AI.

  • Qu'est-ce que c'est : l'application iOS de référence du projet MLC LLM, démontrant l'inférence accélérée par Metal de MLC LLM sur Apple Silicon.
  • Installation : App Store → "MLC Chat". Gratuit.
  • Avantage de vitesse (au niveau architecture) : le moteur accéléré par Metal de MLC LLM génère ~25–35 % plus vite que les applications basées sur llama.cpp sur le même iPhone pour les modèles pris en charge par les deux — mais la propre liste de modèles de l'application précède des choix actuels comme Phi-4 Mini et Gemma 3, rendant cet avantage impossible à vérifier en 2026 sans compiler soi-même.
  • Bibliothèque de modèles : limitée aux modèles compilés par le projet MLC LLM avant que l'application ne devienne inactive — Llama 3.2 3B, RedPajama et modèles similaires de 2024. Tous les GGUF Hugging Face ne fonctionnent pas, et aucun modèle petit de génération actuelle ne figure dans la version App Store.
  • Idéal pour : les développeurs déjà investis dans la chaîne d'outils MLC LLM et prêts à compiler leur propre modèle, ou ceux ayant spécifiquement besoin de l'un des modèles déjà présents datant d'avant 2025.

⚠️Attention: Comme la version App Store de MLC Chat n'a pas été mise à jour depuis fin 2024, n'attendez pas Phi-4 Mini, Qwen3 ou Gemma 3 dans son sélecteur. Si vous voulez des modèles de génération actuelle avec une efficacité GPU de classe Metal aujourd'hui, Locally AI (Apple MLX) ou PocketPal AI (llama.cpp avec Metal Performance Shaders) sont les alternatives activement maintenues.

LLM Farm : retiré mais toujours configurable

LLM Farm a été retiré de l'App Store et de TestFlight en août 2025 — son propre README GitHub décrit l'application comme "temporairement indisponible" sur les deux. Le projet (GitHub : guinmoon/LLMFarm) reste open source et a connu une activité d'issues GitHub jusqu'en 2026, mais les nouveaux utilisateurs ne peuvent plus l'installer depuis l'App Store ; il faut le compiler depuis les sources via Xcode.

  • Qu'est-ce que c'est : une application iOS du développeur @guinmoon qui exécute des modèles GGUF avec de nombreuses options de configuration, auparavant distribuée sur l'App Store.
  • Disponibilité actuelle : non installable depuis l'App Store ou TestFlight au moment de cette mise à jour. Le code source reste public et compilable.
  • Compiler depuis les sources : clonez le dépôt, ouvrez-le dans Xcode, et compilez sur un appareil avec un compte Apple Developer gratuit ou payant — le flux de chargement latéral standard pour toute application iOS open source sans fiche App Store.
  • Configuration exposée (une fois compilée) : température, top-p, top-k, échantillonnage mirostat, pénalité de répétition, instruction système par modèle, sélection du modèle de chat, longueur de la fenêtre de contexte.
  • Idéal pour : les développeurs à l'aise avec la compilation d'une application depuis les sources dans Xcode qui souhaitent spécifiquement les contrôles d'échantillonnage mirostat. Tous les autres devraient utiliser PocketPal AI ou Locally AI, toutes deux entièrement installables depuis l'App Store et gratuites.

⚠️Attention: Ne comptez pas sur un lien App Store vers LLM Farm — traitez tout lien de ce type trouvé ailleurs comme obsolète. Compiler depuis les sources nécessite Xcode et des connaissances de base en signature de code iOS. Si c'est plus d'efforts que vous ne le souhaitez, PocketPal AI couvre le même cas d'usage "application de chat gratuite et flexible" sans quitter l'App Store.

Apple Intelligence : IA on-device intégrée au système

Apple Intelligence exécute le propre modèle de fondation ~3B d'Apple on-device sur iPhone 15 Pro et les modèles plus récents (puce A17 Pro avec 8 Go de RAM minimum). Par défaut, ce n'est pas une application de chat — il alimente des fonctionnalités système dans Mail (Réponse intelligente), Messages (outils d'écriture), Notes (synthèse) et les résumés de notifications. Depuis iOS 26, le framework Foundation Models d'Apple permet aux développeurs tiers d'accéder directement à ce modèle on-device, et des applications comme Locally AI l'exploitent déjà pour offrir une véritable interface de chat.

  • Où il se trouve : intégré à iOS 18+ (framework Foundation Models depuis iOS 26). Activez dans Réglages → Apple Intelligence et Siri.
  • Configuration matérielle requise : iPhone 15 Pro / 15 Pro Max, iPhone 16, iPhone 16e, iPhone 17. Les anciens iPhone (14 et inférieurs) ne prennent pas en charge Apple Intelligence.
  • Fonctionnalités on-device : Outils d'écriture (réécrire, résumer, relire) dans tout champ de texte, Réponse intelligente dans Mail et Messages, Résumés de notifications, génération de Genmoji.
  • Framework Foundation Models (iOS 26+) : une API Swift native donnant aux développeurs un accès direct au même modèle on-device en quelques lignes de code — c'est ainsi que Locally AI l'expose comme option de chat, et comment l'action Shortcuts "Utiliser le modèle" peut acheminer une invite vers lui, vers Private Cloud Compute, ou vers ChatGPT.
  • Private Cloud Compute : pour les tâches dépassant les capacités du modèle on-device, Apple Intelligence bascule vers Private Cloud Compute (PCC) — des serveurs Apple exécutant des modèles plus grands avec des garanties cryptographiques qu'aucune donnée utilisateur n'est conservée. PCC est opt-in et peut être désactivé.
  • Relation avec les applications de chat : Apple Intelligence est un complément, pas un remplacement. Ses fonctionnalités système gèrent la réécriture et la synthèse de texte dans les applications iOS ; PocketPal AI, Private LLM, Locally AI et MLC Chat fournissent une interface de chat dédiée pour les questions arbitraires — et Locally AI peut désormais fournir ce même type d'interface pour le propre modèle d'Apple.

💡Astuce: Si Apple Intelligence est votre seul besoin (réécrire des e-mails, résumer des notifications), vous n'avez pas besoin d'une application de chat séparée. Si vous souhaitez poser des questions au modèle comme "explique la physique quantique en termes simples" ou "rédige un plan de projet pour X", installez une application de chat — une dédiée comme PocketPal AI, ou Locally AI, capable de placer le propre modèle on-device d'Apple derrière une fenêtre de chat.

Modèles recommandés par génération d'iPhone

La RAM de l'iPhone détermine la limite de taille du modèle — pas la génération de puce. Un iPhone 6 Go (14 Pro, 15) peut exécuter confortablement des modèles 1,7B ; un iPhone 8 Go+ (15 Pro, série 16, 16e, série 17) exécute confortablement des modèles 3B–4B et lentement des modèles 7B. Pour le panorama plus large des modèles sur tout le matériel (pas seulement mobile), voir Meilleurs LLM locaux en 2026.

Niveau iPhone (Année, RAM)
Modèle recommandé
Taille de téléchargement
Vitesse estimée
iPhone 17 Pro (2025, 12 Go)Phi-4 Mini ou Llama 3.2 3B (Q4_K_M)~2,5–2,7 Go~13–20 tok/sec
iPhone 16 Pro / 16 Pro Max / 16e (2024–2025, 8 Go)Phi-4 Mini (3,8B Q4_K_M)~2,7 Go~10–15 tok/sec
iPhone 15 Pro / Pro Max (2023, 8 Go)Phi-4 Mini (3,8B Q4_K_M)~2,7 Go~8–12 tok/sec
iPhone 14 Pro / Pro Max (2022, 6 Go)Qwen3 1.7B ou SmolLM 2 1.7B (Q4_K_M)~1,1 Go~15–20 tok/sec
iPhone 14 / 15 / 16 (non Pro, 6 Go)Qwen3 1.7B ou SmolLM 2 1.7B (Q4_K_M)~1,1 Go~12–18 tok/sec
iPhone SE / anciens modèles (4 Go)Non recommandé pour LLM on-device
Recommandations de modèles LLM par RAM iPhone : Phi-4 Mini 3,8B Q4_K_M pour les iPhones 8 Go+ (15 Pro–17 Pro) à 8–20 tok/s ; Qwen3 1,7B Q4_K_M pour les iPhones 6 Go (14 Pro, non-Pro) à 12–20 tok/s ; iPhone SE (4 Go) déconseillé.
Recommandations de modèles LLM par RAM iPhone : Phi-4 Mini 3,8B Q4_K_M pour les iPhones 8 Go+ (15 Pro–17 Pro) à 8–20 tok/s ; Qwen3 1,7B Q4_K_M pour les iPhones 6 Go (14 Pro, non-Pro) à 12–20 tok/s ; iPhone SE (4 Go) déconseillé.

💡Astuce: Pour les anciens iPhone 6 Go, Qwen3 1.7B offre le meilleur équilibre taille/qualité en 2026. SmolLM 2 1.7B (HuggingFace) est comparable. Les deux produisent des réponses courtes cohérentes (1–3 paragraphes) mais peinent avec le raisonnement multi-étapes. N'installez pas Phi-4 Mini sur un iPhone 6 Go — il tient nominalement mais iOS arrêtera l'application sous toute pression mémoire.

Autonomie et surchauffe

L'inférence LLM on-device sur iPhone est intensive en CPU/GPU et génère de la chaleur. L'inférence active (modèle générant des tokens) consomme ~3–5 W ; une génération soutenue fera ralentir la puce et drainera la batterie d'environ 20–30 % par heure sur iPhone 16 Pro.

  • Consommation de batterie (chat actif) : ~20–30 % par heure sur iPhone 16 Pro avec Phi-4 Mini. L'iPhone 17 Pro se décharge légèrement plus vite en raison d'une puissance de pointe plus élevée, mais compense en terminant la charge de travail plus tôt.
  • La limitation thermique intervient après ~10–15 minutes de génération continue. Lorsque la température de surface de la puce atteint ~38 °C, iOS réduit les fréquences d'horloge, faisant chuter les tokens/sec de 30–50 %. Laisser le téléphone refroidir restaure la pleine vitesse.
  • Atténuation : gardez l'iPhone face vers le haut sur une surface dure (pas dans la main ou la poche) lors des longues sessions d'inférence pour permettre la dissipation de chaleur. Un étui dissipateur passif aide mais est rarement nécessaire pour les courtes interactions.
  • Consommation fantôme : si vous laissez une application de chat ouverte en arrière-plan après la génération, la RAM reste allouée mais aucune inférence ne tourne — l'impact sur la batterie est minimal. Fermer complètement l'application libère les ~3 Go de RAM.
  • Charge MagSafe pendant l'inférence : acceptable sur iPhone 17 Pro et 16 Pro (tous deux ont des conceptions thermiques améliorées). Sur iPhone 15 Pro, la combinaison charge + inférence peut atteindre les limites thermiques plus rapidement — préférez charger après.
Guide thermique LLM on-device iPhone : l'inférence active consomme 3–5W (~20–30% batterie/h sur iPhone 16 Pro) ; la bride thermique réduit la vitesse de 30–50% après 10–15 min — posez l'écran vers le haut sur une surface dure.
Guide thermique LLM on-device iPhone : l'inférence active consomme 3–5W (~20–30% batterie/h sur iPhone 16 Pro) ; la bride thermique réduit la vitesse de 30–50% après 10–15 min — posez l'écran vers le haut sur une surface dure.

⚠️Attention: N'exécutez pas d'inférence LLM on-device sur un iPhone exposé au soleil direct ou dans une voiture chaude. La combinaison de la chaleur ambiante et de la charge d'inférence pousse la puce au-delà des limites thermiques en quelques minutes, déclenchant une limitation agressive et potentiellement l'avertissement "L'iPhone doit refroidir". L'application de chat ne plante pas, mais la génération ralentit à une vitesse d'exploration.

Raccourcis iOS, Siri et chargement latéral

L'intégration iOS varie considérablement selon les applications. Private LLM et Locally AI proposent tous deux des actions Shortcuts ; PocketPal AI et MLC Chat sont des applications de chat autonomes sans actions Shortcuts en 2026.

Raccourci Private LLM : résumer le texte sélectionné

1. Action : "Obtenir le texte sélectionné" (entrée Share Sheet iOS). 2. Action : "Générer du texte avec Private LLM" → Invite : "Résume le texte suivant en trois points clés : [Texte sélectionné]" → Modèle : Phi-4 Mini. 3. Action : "Afficher le résultat" ou "Copier dans le presse-papiers". Ajoutez à Share Sheet pour l'exécuter sur tout texte sélectionné dans n'importe quelle application, entièrement hors ligne.

Raccourci Apple Intelligence : réécrire sur un ton professionnel

1. Action : "Obtenir le presse-papiers". 2. Action : "Utiliser le modèle" → Modèle : On-device → Invite : "Réécris ceci sur un ton professionnel et concis : [Presse-papiers]". 3. Action : "Copier dans le presse-papiers". Assignez à un widget de l'écran de verrouillage pour réécrire en un tap tout ce que vous copiez.
  • Private LLM expose une action Shortcuts "Générer du texte avec Private LLM" et un déclencheur vocal "Dis Siri, demande à Private LLM [question]". La plus intégrée nativement à iOS des applications de chat payantes.
  • Locally AI expose une action Shortcuts gratuitement et peut acheminer un raccourci vers le propre modèle on-device d'Apple via son intégration Foundation Models — pas de déclencheur vocal, mais une automatisation Shortcuts sans payer.
  • PocketPal AI est une application de chat autonome — pas d'action Shortcuts, pas d'intégration Siri. Vous ouvrez l'application et chatez. Des plans pour le support Shortcuts sont suivis dans les issues GitHub mais non livrés.
  • MLC Chat est une application de référence pour le projet MLC LLM — intégration iOS minimale et aucune mise à jour depuis fin 2024. Pas d'action Shortcuts.
  • LLM Farm est retiré de l'App Store (août 2025) et, une fois compilé depuis les sources, n'a pas d'action Shortcuts.
  • Apple Intelligence s'intègre avec iOS Shortcuts via l'action "Utiliser le modèle" (iOS 18.4+, étendue avec le framework Foundation Models en iOS 26). Cette action achemine une invite vers le modèle on-device, Private Cloud Compute, ou ChatGPT (configurable). La sortie on-device peut être enchaînée dans d'autres actions Shortcuts.
  • Chargement latéral : PocketPal AI, Private LLM, Locally AI et MLC Chat sont sur l'App Store et ne nécessitent pas de chargement latéral ou de jailbreak ; Apple Intelligence est intégré à iOS. LLM Farm est l'exception — son installation nécessite désormais de compiler depuis les sources dans Xcode. Les utilisateurs UE peuvent également installer les applications de l'App Store via des marketplaces alternatives en vertu du DMA en 2026, mais l'application elle-même est identique.
Intégration iOS par app LLM locale : Private LLM, Locally AI et Apple Intelligence prennent en charge Raccourcis (Private LLM ajoute Siri) ; PocketPal AI et MLC Chat sont des apps de chat autonomes sans actions Raccourcis en 2026.
Intégration iOS par app LLM locale : Private LLM, Locally AI et Apple Intelligence prennent en charge Raccourcis (Private LLM ajoute Siri) ; PocketPal AI et MLC Chat sont des apps de chat autonomes sans actions Raccourcis en 2026.

💡Astuce: Pour une utilisation mains libres en conduisant ou en cuisinant, le "Dis Siri, demande à Private LLM" de Private LLM est la seule option on-device fonctionnant sans toucher le téléphone. Apple Intelligence prend en charge la voix via Siri mais uniquement pour les tâches système (écriture, synthèse, actions d'application) — il n'expose pas le Q&A général comme les applications de chat.

Erreurs fréquentes

  • Installer un modèle plus grand que ce que la RAM de votre iPhone permet. Un modèle 7B sur un iPhone 8 Go génère à ~3–5 tokens/sec — frustrant pour le chat. iOS tend également à arrêter l'application quand d'autres applications ont besoin de mémoire. Tenez-vous-en aux modèles recommandés pour votre niveau iPhone (3B–4B pour les appareils 8 Go, 1,7B pour les appareils 6 Go).
  • S'attendre à une qualité d'IA cloud avec des modèles on-device. Phi-4 Mini (3,8B) est impressionnant pour sa taille mais pas au niveau de GPT-5.5. Utilisez-le pour le chat, la synthèse, la rédaction et les Q&A rapides — pas pour le raisonnement multi-étapes, la génération de code complexe ou l'écriture créative nuancée.
  • Exécuter l'inférence en plein soleil ou dans une voiture chaude. La limitation thermique intervient en quelques minutes. La génération ralentit de 30–50 %, et vous pouvez voir l'avertissement "L'iPhone doit refroidir". Exécutez l'inférence à température ambiante.
  • Laisser 3+ applications de chat installées avec des modèles de 3 Go dans chacune. Vous consommerez ~10 Go de stockage en modèles dupliqués. Choisissez une application et un modèle ; désinstallez les autres jusqu'à être sûr d'en avoir besoin.
  • Supposer qu'Apple Intelligence n'a aucune interface de chat. C'était vrai jusqu'à iOS 18, mais depuis iOS 26 des applications comme Locally AI peuvent placer le modèle on-device d'Apple derrière une vraie fenêtre de chat via le framework Foundation Models. Les fonctionnalités système (Outils d'écriture, Réponse intelligente) ne sont toujours pas une interface de chat en elles-mêmes.
  • Chercher LLM Farm sur l'App Store. Il a été retiré en août 2025. Le rechercher sur l'App Store est une perte de temps ; utilisez PocketPal AI pour le même cas d'usage gratuit/flexible, ou compilez LLM Farm depuis les sources dans Xcode si vous avez spécifiquement besoin de ses contrôles mirostat.

Sources

Questions fréquemment posées

L'iPhone peut-il vraiment faire tourner un modèle 7B ?

Techniquement oui sur iPhone 15 Pro et les modèles plus récents (8 Go de RAM), mais pas à une vitesse utilisable. Un modèle 7B Q4 sur iPhone 16 Pro génère à ~3–5 tokens/sec — frustrant pour le chat. iOS tend également à arrêter l'application quand d'autres applications ont besoin de mémoire. Utilisez des modèles 3B–4B (Phi-4 Mini, Llama 3.2 3B, Gemma 3 4B) pour le chat on-device quotidien. Pour une qualité 7B+, connectez-vous à distance à un Mac ou PC domestique exécutant Ollama.

L'IA locale drainera-t-elle la batterie de mon iPhone ?

Oui — l'inférence active consomme ~3–5 W et draine la batterie d'environ 20–30 % par heure sur iPhone 16 Pro. Pour un usage occasionnel (quelques invites), l'impact est faible. Pour un usage soutenu (longue conversation, plusieurs tâches de synthèse), gardez l'iPhone branché. Le modèle lui-même restant en RAM sans inférence active a un impact négligeable sur la batterie.

Mon iPhone chauffera-t-il en utilisant l'IA locale ?

Oui, après environ 10–15 minutes de génération continue. La surface de la puce atteint ~38 °C et iOS réduit les fréquences d'horloge, faisant chuter les tokens/sec de 30–50 %. Pour minimiser cela : gardez l'iPhone face vers le haut sur une surface dure (pas dans la main) lors des longues sessions, et évitez le soleil direct. Les courtes interactions (moins de 5 minutes) causent rarement une chaleur notable.

Puis-je utiliser Siri avec un modèle local ?

Oui, avec Private LLM (5,99 € en achat unique). En disant "Dis Siri, demande à Private LLM [question]", l'invite est acheminée vers le modèle on-device et Siri lit la réponse — entièrement hors ligne. PocketPal AI, Locally AI et MLC Chat n'ont pas d'intégration vocale Siri en 2026, bien que Locally AI prenne en charge l'automatisation Shortcuts. Apple Intelligence s'intègre avec Siri mais uniquement pour les tâches système (écriture, synthèse, actions d'application), pas pour le Q&A général.

Ces applications fonctionnent-elles sur iPhone SE ou les anciens iPhone ?

Limitée. L'iPhone SE (4 Go de RAM) est en dessous du seuil pratique pour les LLM on-device en 2026. iPhone 14 / 15 (non Pro, 6 Go de RAM) peut faire tourner des modèles 1,7B (Qwen3 1.7B, SmolLM 2 1.7B) mais pas 3B+. iPhone 14 Pro et 15 Pro (6–8 Go de RAM) peuvent faire tourner des modèles 3B comme Phi-4 Mini à 8–12 tokens/sec. Pour les anciens iPhone, la meilleure solution est de se connecter à distance à un Mac ou PC domestique.

Puis-je synchroniser l'historique de chat entre iPhone et Mac ?

Pas dans PocketPal AI, Private LLM ou MLC Chat — l'historique de chat est stocké localement sur chaque appareil, sans synchronisation iCloud. Private LLM et Locally AI sont tous deux des achats/téléchargements universels fonctionnant nativement sur Mac aussi, mais l'historique ne se synchronise toujours pas entre les copies iPhone et Mac. Pour un historique de chat entre appareils, l'approche pratique est d'exécuter Open WebUI sur un Mac domestique et d'y accéder depuis les deux navigateurs — Open WebUI stocke l'historique de chat côté serveur.

Ces applications sont-elles disponibles en dehors de l'App Store ?

PocketPal AI est open source et peut être compilé depuis les sources via Xcode, mais la version App Store est la distribution standard. LLM Farm est l'exception qui doit désormais être compilée depuis les sources — elle a été retirée de l'App Store et de TestFlight en août 2025. Private LLM, Locally AI et MLC Chat sont uniquement sur l'App Store. Les utilisateurs UE peuvent installer les applications de l'App Store via des marketplaces alternatives en vertu du DMA en 2026, mais l'application sous-jacente est identique.

L'une d'elles nécessite-t-elle un jailbreak ?

Non. PocketPal AI, Private LLM, Locally AI, MLC Chat et Apple Intelligence fonctionnent tous sur iOS standard. Compiler LLM Farm depuis les sources dans Xcode ne nécessite pas non plus de jailbreak — cela utilise le chargement latéral standard pour développeurs, pas un exploit de jailbreak. Le jailbreak n'est requis ni recommandé pour aucune de ces applications.

Puis-je utiliser l'IA locale dans iOS Shortcuts ?

Oui, via Private LLM (action "Générer du texte avec Private LLM"), Locally AI (action Shortcuts gratuite) ou Apple Intelligence (action "Utiliser le modèle", iOS 18.4+, étendue avec iOS 26). PocketPal AI et MLC Chat n'ont pas d'actions Shortcuts en 2026. Locally AI est la seule option gratuite offrant à la fois le support Shortcuts et l'accès au propre modèle on-device d'Apple.

Comment l'IA locale se compare-t-elle à l'application ChatGPT sur iPhone ?

Les modèles on-device (Phi-4 Mini, Llama 3.2 3B) restent sensiblement en retrait des modèles cloud de pointe pour le raisonnement complexe, les connaissances générales du monde et les tâches multimodales, mais sont plus rapides sur les requêtes simples (sans aller-retour réseau) et entièrement privés. Le compromis honnête : IA locale pour les tâches routinières et privées ; ChatGPT ou une autre application cloud pour les questions difficiles occasionnelles. De nombreux utilisateurs en 2026 ont les deux et choisissent selon la requête.

LLM Farm est-il encore sûr à utiliser maintenant qu'il n'est plus sur l'App Store ?

Le code source est public sur GitHub et continue de recevoir de l'activité d'issues jusqu'en 2026, il n'est donc pas abandonné, mais une fois compilé depuis les sources et chargé latéralement, il ne passe plus par le processus de révision de l'App Store d'Apple. Si vous n'avez pas spécifiquement besoin de ses contrôles d'échantillonnage mirostat, PocketPal AI couvre le même cas d'usage gratuit/flexible/open source tout en restant sur l'App Store avec la révision standard d'Apple.

← Retour aux LLM locaux avancés