Points clés
- OlliteRT (github.com/NightMean/OlliteRT) est une application Android gratuite et open source qui exécute des LLM localement et les sert via HTTP — pas une application de chat
- Créé par le développeur NightMean ; dépôt créé le 6 avril 2026
- Sous licence Apache-2.0, confirmé via les métadonnées de licence du dépôt GitHub
- Fonctionne entièrement sur l'appareil via le moteur LiteRT-LM de Google, en utilisant exclusivement des fichiers de modèle
.litertlm— ne prend pas en charge GGUF - Expose une API HTTP compatible OpenAI (chat completions, completions) ainsi que des points de terminaison compatibles API Anthropic Messages, pour que d'autres appareils du réseau local puissent l'appeler
- Plus de 350 étoiles GitHub et 47 forks au moment de cet avis ; la dernière version taguée est v0.9.6-beta.1 (6 juin 2026), le projet n'a donc pas encore atteint une version 1.0
📍 En une phrase
OlliteRT est une application Android gratuite et open source (Apache-2.0), créée par le développeur NightMean, qui transforme un smartphone en serveur d'inférence LLM entièrement local et compatible OpenAI grâce au moteur LiteRT-LM de Google, avec plus de 350 étoiles GitHub au moment de cet avis.
💬 En termes simples
Au lieu de faire tourner une application de chat sur votre smartphone, OlliteRT transforme le smartphone lui-même en petit serveur : vous y chargez un modèle, démarrez le serveur, et d'autres appareils de votre réseau domestique — un ordinateur portable, un script, un outil domotique — peuvent lui envoyer du texte et recevoir une réponse, de la même façon qu'ils parleraient à l'API d'OpenAI, sauf que tout tourne sur le smartphone.
📌Remarque: Cet avis se base sur le dépôt GitHub, le README et l'historique des versions d'OlliteRT. Il n'affirme pas que PromptQuorum a réalisé ses propres tests de débit ou de consommation de batterie sur un modèle de smartphone spécifique.
Qu'est-ce qu'OlliteRT ?
OlliteRT est une application Android qui transforme le smartphone sur lequel elle tourne en serveur d'inférence LLM local, décrite dans la description de son propre dépôt GitHub comme permettant de « transformer votre smartphone Android en serveur d'inférence LLM compatible OpenAI — entièrement local, privé et open source ». Elle n'a pas de fenêtre de chat intégrée ; son but est d'exécuter l'inférence et de répondre aux requêtes HTTP d'autres logiciels.
- Type de produit : une application serveur backend Android, pas un client de chat — aucune interface de chat incluse
- Créateur : le développeur NightMean ; le dépôt GitHub se trouve à github.com/NightMean/OlliteRT
- Dépôt créé le 6 avril 2026, selon les métadonnées du dépôt GitHub — un projet jeune au moment de cet avis
- Licence : Apache-2.0, confirmée via les métadonnées de licence du dépôt GitHub
- Moteur d'inférence : le moteur d'exécution embarqué LiteRT-LM de Google, la même technologie sous-jacente que Google utilise pour ses propres fonctionnalités d'IA embarquée dans ses outils Android
- Ampleur : plus de 350 étoiles GitHub et 47 forks au moment de cet avis
Historique du projet et jalons de versions
Le dépôt GitHub d'OlliteRT a été créé le 6 avril 2026, et il a publié depuis trois versions pré-1.0 taguées, toutes encore étiquetées bêta.
- 16 avril 2026 : Dépôt créé
Why it matters: Marque le début du projet, selon les métadonnées du dépôt GitHub. - 2v0.9.0-beta.1 — 24 avril 2026
Why it matters: La première version taguée trouvée sur la page des releases GitHub du projet. - 3v0.9.5-beta.1 — 30 avril 2026
Why it matters: Une version bêta de suivi environ une semaine après le premier tag. - 4v0.9.6-beta.1 — 6 juin 2026
Why it matters: La version taguée la plus récente au moment de cet avis ; le projet n'a pas encore publié de version 1.0.
Que fait réellement OlliteRT ?
OlliteRT charge un fichier de modèle .litertlm sur le smartphone, exécute l'inférence via le moteur LiteRT-LM de Google en utilisant le CPU et le GPU propres du smartphone, et sert le résultat via une API HTTP compatible OpenAI que d'autres appareils du même réseau peuvent appeler.
- Inférence sur l'appareil : utilise exclusivement le moteur LiteRT-LM de Google — aucun repli cloud, aucun autre moteur backend
- Format de modèle : fichiers
.litertlmuniquement ; ne prend pas en charge GGUF, le format utilisé par les outils basés sur llama.cpp - Acquisition de modèles : téléchargements en un clic directement depuis HuggingFace pour les modèles pris en charge, selon le README du projet
- Compatibilité API : expose des points de terminaison compatibles OpenAI chat-completions et completions, ainsi que des points de terminaison compatibles API Anthropic Messages, via HTTP sur le réseau local
- Support multimodal : les modèles de vision, audio et de « raisonnement » (thinking) sont pris en charge lorsque le modèle sous-jacent lui-même prend en charge ces modes, selon le README
- Accélération matérielle : paramètres d'accélération GPU ou CPU configurables par modèle
- Outils opérationnels : un outil de benchmarking intégré, une journalisation d'activité avec mise en évidence JSON, un tableau de bord de surveillance du serveur, une intégration de métriques Prometheus, et une intégration API REST Home Assistant
- Conception à modèle unique et séquentielle : le README documente qu'un seul modèle est chargé à la fois et que les requêtes sont traitées séquentiellement, pas en parallèle
Exemples d'utilisation : deux façons d'utiliser OlliteRT
Voici des flux de travail concrets construits à partir des fonctionnalités documentées du projet ci-dessus.
Installer OlliteRT
OlliteRT s'installe gratuitement sous forme d'APK depuis les releases GitHub, et son code source est sur GitHub.
Source | Lien |
|---|---|
| Releases GitHub (téléchargement APK) | github.com/NightMean/OlliteRT/releases |
| Dépôt GitHub (code source, Apache-2.0) | github.com/NightMean/OlliteRT |
Au moment de cet avis, OlliteRT n'est distribué que via téléchargement direct de l'APK depuis les releases GitHub — cet avis n'a trouvé aucune fiche sur Google Play ou F-Droid. Nécessite Android 12 ou ultérieur sur un appareil arm64-v8a. Installer un APK en dehors de Google Play nécessite d'activer « l'installation depuis des sources inconnues » dans les paramètres Android ; ne téléchargez l'APK que depuis la page officielle des releases GitHub.
Plateforme, tarifs et licence
Plateforme
- Ce qu'indique OlliteRT:
- Android uniquement (appareils arm64-v8a, Android 12+). Pas de version iOS, bureau ou web.
Coût
- Ce qu'indique OlliteRT:
- Gratuit et open source. Aucun compte, abonnement ou achat intégré trouvé dans le README.
Licence
- Ce qu'indique OlliteRT:
- Apache-2.0, confirmée via les métadonnées de licence du dépôt GitHub.
Minimum matériel
- Ce qu'indique OlliteRT:
- Minimum 6 Go de RAM selon le README ; 8 Go+ recommandé, et davantage pour des modèles plus grands ou multimodaux comme Gemma 4 E4B (nécessite 12 Go de RAM).
Méthode d'installation
- Ce qu'indique OlliteRT:
- Téléchargement direct de l'APK depuis la page des releases GitHub ; aucune fiche Google Play ou F-Droid trouvée au moment de cet avis.
Vérifiez les recommandations matérielles actuelles et la liste des modèles pris en charge directement sur GitHub avant de choisir un smartphone ou un modèle, car les deux peuvent évoluer à mesure que le projet (encore pré-1.0) mûrit.
OlliteRT vs. PocketPal AI
OlliteRT et PocketPal AI exécutent tous deux des LLM localement sur un smartphone, mais dans des buts différents : OlliteRT est un serveur headless auquel d'autres appareils parlent, tandis que PocketPal AI est une application de chat que vous utilisez directement sur le smartphone lui-même.
Aspect | OlliteRT | PocketPal AI |
|---|---|---|
| Usage principal | Serveur d'inférence headless pour d'autres appareils du réseau | Application de chat sur l'appareil, utilisée directement sur le smartphone |
| Interface de chat | Aucune incluse | Interface de chat intégrée |
| Moteur d'inférence | Google LiteRT-LM | Basé sur llama.cpp (modèles GGUF) |
| Format de modèle | .litertlm uniquement | GGUF |
| Plateforme | Android uniquement | Android et iOS |
| Serveur API | API HTTP compatible OpenAI, fonctionnalité centrale | Pas une fonctionnalité centrale |
Si vous voulez envoyer des requêtes depuis un ordinateur portable, un script ou un hub domotique vers un smartphone agissant comme serveur, OlliteRT est conçu pour cela. Si vous voulez discuter avec un modèle local directement sur l'écran du smartphone, une application orientée chat comme PocketPal AI convient mieux — voir l'avis PocketPal AI pour plus de détails.
À qui s'adresse OlliteRT ?
OlliteRT convient aux développeurs et amateurs qui veulent reconvertir un smartphone Android en serveur LLM dédié et entièrement local pour d'autres appareils, plutôt que de discuter avec un modèle sur le smartphone lui-même.
Pour quoi OlliteRT n'est pas adapté
OlliteRT n'est pas adapté si vous avez besoin d'une interface de chat, du support de modèles GGUF, du traitement de requêtes en parallèle, ou d'un historique de versions long et établi.
- Pas une application de chat — elle n'a pas de fenêtre de chat intégrée ; elle ne répond qu'aux requêtes API HTTP d'autres logiciels
- Pas compatible GGUF — fonctionne exclusivement avec des fichiers de modèle
.litertlm, elle ne peut donc pas charger les modèles GGUF utilisés par llama.cpp, Ollama ou la plupart des autres outils LLM locaux sans une étape de conversion séparée - Pas conçue pour une charge simultanée — le README documente un seul modèle chargé traité séquentiellement, elle n'est donc pas conçue comme un serveur multi-utilisateur ou à haut débit
- Pas compatible iOS — Android uniquement, et spécifiquement les appareils arm64-v8a
- Pas une version 1.0 mature — le dépôt a environ cinq mois au moment de cet avis, et sa dernière version taguée (v0.9.6-beta.1) porte toujours une étiquette bêta
Erreurs courantes en évaluant OlliteRT
La plupart des confusions sur OlliteRT viennent du fait de supposer qu'il s'agit d'une application de chat, de confondre son format de modèle avec GGUF, ou de passer à côté de son statut de jeune projet.
Concurrents et alternatives
OlliteRT est le plus souvent comparé à d'autres applications LLM locales Android/mobiles — son principal facteur de différenciation est d'être un serveur headless compatible OpenAI plutôt qu'un client de chat sur le smartphone.
Outil | Connu pour | Lien |
|---|---|---|
| PocketPal AI | Application de chat sur l'appareil pour Android et iOS, modèles GGUF via llama.cpp | PocketPal AI avis |
| Layla | Application de chat Android axée sur le jeu de rôle local et non censuré et l'usage assistant | Layla avis |
| Google AI Edge Gallery | L'application vitrine de Google pour les modèles embarqués via LiteRT/MediaPipe | Google AI Edge Gallery avis |
| MLC Chat | Application de chat locale multiplateforme (Android/iOS) construite sur la pile de compilation MLC LLM | MLC Chat avis |
Cette liste reflète les outils couramment comparés à OlliteRT dans l'espace des LLM mobiles/embarqués, pas un classement indépendant de PromptQuorum — vérifiez les fonctionnalités actuelles et les formats de modèle pris en charge par chaque outil avant de choisir.
Questions fréquemment posées
Qu'est-ce qu'OlliteRT ?
OlliteRT (github.com/NightMean/OlliteRT) est une application Android gratuite et open source (Apache-2.0), créée par le développeur NightMean, qui transforme un smartphone en serveur d'inférence LLM entièrement local et compatible OpenAI grâce au moteur LiteRT-LM de Google.
OlliteRT dispose-t-il d'une interface de chat ?
Non. OlliteRT n'a pas de fenêtre de chat intégrée. C'est un serveur headless — vous interagissez avec lui via son API HTTP depuis un autre appareil ou une autre application, pas en tapant directement dans l'application.
OlliteRT est-il gratuit ?
Oui, OlliteRT est gratuit et open source sous licence Apache-2.0. Cet avis n'a trouvé aucune exigence de compte, d'abonnement ou d'achat intégré.
Quel format de modèle utilise OlliteRT ?
OlliteRT utilise exclusivement des fichiers de modèle .litertlm, pour le moteur d'exécution embarqué LiteRT-LM de Google. Il ne prend pas en charge GGUF, le format utilisé par les outils basés sur llama.cpp.
Quelles sont les exigences matérielles d'OlliteRT ?
Android 12 ou ultérieur sur un appareil arm64-v8a, avec un minimum de 6 Go de RAM (8 Go+ recommandé). Des modèles plus grands ou multimodaux, comme Gemma 4 E4B, nécessitent 12 Go de RAM ou plus, selon le README du projet.
OlliteRT fonctionne-t-il sans connexion Internet ?
L'inférence elle-même s'exécute entièrement sur l'appareil une fois un modèle téléchargé, aucune connexion Internet n'est donc nécessaire pour cela. Une connexion réseau locale est nécessaire pour que d'autres appareils atteignent le serveur API du smartphone, et un accès Internet est nécessaire pour télécharger initialement les modèles depuis HuggingFace.
OlliteRT peut-il traiter plusieurs requêtes à la fois ?
Non. Le README du projet documente qu'un seul modèle est chargé à la fois et que les requêtes sont traitées séquentiellement, pas en parallèle — il n'est pas conçu pour une charge simultanée multi-utilisateur.
OlliteRT est-il disponible sur iOS ?
Non, OlliteRT est réservé à Android, et nécessite spécifiquement un appareil arm64-v8a fonctionnant sous Android 12 ou ultérieur.
Comment installer OlliteRT ?
Téléchargez l'APK directement depuis la page des releases GitHub. Au moment de cet avis, elle n'est pas listée sur Google Play ni sur F-Droid.
OlliteRT est-il un projet mature et stable ?
Pas encore. Son dépôt GitHub a été créé en avril 2026, et sa dernière version taguée (v0.9.6-beta.1, juin 2026) porte toujours une étiquette bêta — considérez-le comme un projet pré-1.0 en développement actif.