Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/OlliteRT : avis sur un serveur LLM local pour Android
Mobile & Edge LLMs

OlliteRT : avis sur un serveur LLM local pour Android

·10 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

OlliteRT est une application Android gratuite et open source qui transforme un smartphone en serveur d'inférence LLM entièrement local et compatible OpenAI, décrite par son propre créateur comme « Ollama pour Android ». Elle exécute les modèles entièrement sur l'appareil via le moteur LiteRT-LM de Google avec des fichiers de modèle .litertlm, expose des points de terminaison HTTP compatibles chat-completions et Anthropic Messages sur le réseau local, et ne dispose d'aucune interface de chat propre — c'est un backend auquel d'autres applications ou appareils se connectent.

OlliteRT (github.com/NightMean/OlliteRT) est une application Android gratuite et open source, créée par le développeur NightMean, qui transforme un smartphone en serveur d'inférence LLM entièrement local et compatible OpenAI. Elle fonctionne entièrement sur le moteur d'exécution embarqué LiteRT-LM de Google, nécessite des fichiers de modèle .litertlm, et n'a pas d'interface de chat propre — d'autres appareils du même réseau lui parlent via HTTP. Cet avis détaille exactement ce qu'elle fait, ses exigences matérielles et à qui elle convient.

Points clés

  • OlliteRT (github.com/NightMean/OlliteRT) est une application Android gratuite et open source qui exécute des LLM localement et les sert via HTTP — pas une application de chat
  • Créé par le développeur NightMean ; dépôt créé le 6 avril 2026
  • Sous licence Apache-2.0, confirmé via les métadonnées de licence du dépôt GitHub
  • Fonctionne entièrement sur l'appareil via le moteur LiteRT-LM de Google, en utilisant exclusivement des fichiers de modèle .litertlm — ne prend pas en charge GGUF
  • Expose une API HTTP compatible OpenAI (chat completions, completions) ainsi que des points de terminaison compatibles API Anthropic Messages, pour que d'autres appareils du réseau local puissent l'appeler
  • Plus de 350 étoiles GitHub et 47 forks au moment de cet avis ; la dernière version taguée est v0.9.6-beta.1 (6 juin 2026), le projet n'a donc pas encore atteint une version 1.0

📍 En une phrase

OlliteRT est une application Android gratuite et open source (Apache-2.0), créée par le développeur NightMean, qui transforme un smartphone en serveur d'inférence LLM entièrement local et compatible OpenAI grâce au moteur LiteRT-LM de Google, avec plus de 350 étoiles GitHub au moment de cet avis.

💬 En termes simples

Au lieu de faire tourner une application de chat sur votre smartphone, OlliteRT transforme le smartphone lui-même en petit serveur : vous y chargez un modèle, démarrez le serveur, et d'autres appareils de votre réseau domestique — un ordinateur portable, un script, un outil domotique — peuvent lui envoyer du texte et recevoir une réponse, de la même façon qu'ils parleraient à l'API d'OpenAI, sauf que tout tourne sur le smartphone.

📌Remarque: Cet avis se base sur le dépôt GitHub, le README et l'historique des versions d'OlliteRT. Il n'affirme pas que PromptQuorum a réalisé ses propres tests de débit ou de consommation de batterie sur un modèle de smartphone spécifique.

Qu'est-ce qu'OlliteRT ?

OlliteRT est une application Android qui transforme le smartphone sur lequel elle tourne en serveur d'inférence LLM local, décrite dans la description de son propre dépôt GitHub comme permettant de « transformer votre smartphone Android en serveur d'inférence LLM compatible OpenAI — entièrement local, privé et open source ». Elle n'a pas de fenêtre de chat intégrée ; son but est d'exécuter l'inférence et de répondre aux requêtes HTTP d'autres logiciels.

  • Type de produit : une application serveur backend Android, pas un client de chat — aucune interface de chat incluse
  • Créateur : le développeur NightMean ; le dépôt GitHub se trouve à github.com/NightMean/OlliteRT
  • Dépôt créé le 6 avril 2026, selon les métadonnées du dépôt GitHub — un projet jeune au moment de cet avis
  • Licence : Apache-2.0, confirmée via les métadonnées de licence du dépôt GitHub
  • Moteur d'inférence : le moteur d'exécution embarqué LiteRT-LM de Google, la même technologie sous-jacente que Google utilise pour ses propres fonctionnalités d'IA embarquée dans ses outils Android
  • Ampleur : plus de 350 étoiles GitHub et 47 forks au moment de cet avis

Historique du projet et jalons de versions

Le dépôt GitHub d'OlliteRT a été créé le 6 avril 2026, et il a publié depuis trois versions pré-1.0 taguées, toutes encore étiquetées bêta.

  1. 1
    6 avril 2026 : Dépôt créé
    Why it matters: Marque le début du projet, selon les métadonnées du dépôt GitHub.
  2. 2
    v0.9.0-beta.1 — 24 avril 2026
    Why it matters: La première version taguée trouvée sur la page des releases GitHub du projet.
  3. 3
    v0.9.5-beta.1 — 30 avril 2026
    Why it matters: Une version bêta de suivi environ une semaine après le premier tag.
  4. 4
    v0.9.6-beta.1 — 6 juin 2026
    Why it matters: La version taguée la plus récente au moment de cet avis ; le projet n'a pas encore publié de version 1.0.

Que fait réellement OlliteRT ?

OlliteRT charge un fichier de modèle .litertlm sur le smartphone, exécute l'inférence via le moteur LiteRT-LM de Google en utilisant le CPU et le GPU propres du smartphone, et sert le résultat via une API HTTP compatible OpenAI que d'autres appareils du même réseau peuvent appeler.

  • Inférence sur l'appareil : utilise exclusivement le moteur LiteRT-LM de Google — aucun repli cloud, aucun autre moteur backend
  • Format de modèle : fichiers .litertlm uniquement ; ne prend pas en charge GGUF, le format utilisé par les outils basés sur llama.cpp
  • Acquisition de modèles : téléchargements en un clic directement depuis HuggingFace pour les modèles pris en charge, selon le README du projet
  • Compatibilité API : expose des points de terminaison compatibles OpenAI chat-completions et completions, ainsi que des points de terminaison compatibles API Anthropic Messages, via HTTP sur le réseau local
  • Support multimodal : les modèles de vision, audio et de « raisonnement » (thinking) sont pris en charge lorsque le modèle sous-jacent lui-même prend en charge ces modes, selon le README
  • Accélération matérielle : paramètres d'accélération GPU ou CPU configurables par modèle
  • Outils opérationnels : un outil de benchmarking intégré, une journalisation d'activité avec mise en évidence JSON, un tableau de bord de surveillance du serveur, une intégration de métriques Prometheus, et une intégration API REST Home Assistant
  • Conception à modèle unique et séquentielle : le README documente qu'un seul modèle est chargé à la fois et que les requêtes sont traitées séquentiellement, pas en parallèle

Exemples d'utilisation : deux façons d'utiliser OlliteRT

Voici des flux de travail concrets construits à partir des fonctionnalités documentées du projet ci-dessus.

Plateforme, tarifs et licence

Plateforme

Ce qu'indique OlliteRT:
Android uniquement (appareils arm64-v8a, Android 12+). Pas de version iOS, bureau ou web.

Coût

Ce qu'indique OlliteRT:
Gratuit et open source. Aucun compte, abonnement ou achat intégré trouvé dans le README.

Licence

Ce qu'indique OlliteRT:
Apache-2.0, confirmée via les métadonnées de licence du dépôt GitHub.

Minimum matériel

Ce qu'indique OlliteRT:
Minimum 6 Go de RAM selon le README ; 8 Go+ recommandé, et davantage pour des modèles plus grands ou multimodaux comme Gemma 4 E4B (nécessite 12 Go de RAM).

Méthode d'installation

Ce qu'indique OlliteRT:
Téléchargement direct de l'APK depuis la page des releases GitHub ; aucune fiche Google Play ou F-Droid trouvée au moment de cet avis.

Vérifiez les recommandations matérielles actuelles et la liste des modèles pris en charge directement sur GitHub avant de choisir un smartphone ou un modèle, car les deux peuvent évoluer à mesure que le projet (encore pré-1.0) mûrit.

OlliteRT vs. PocketPal AI

OlliteRT et PocketPal AI exécutent tous deux des LLM localement sur un smartphone, mais dans des buts différents : OlliteRT est un serveur headless auquel d'autres appareils parlent, tandis que PocketPal AI est une application de chat que vous utilisez directement sur le smartphone lui-même.

Aspect
OlliteRT
PocketPal AI
Usage principalServeur d'inférence headless pour d'autres appareils du réseauApplication de chat sur l'appareil, utilisée directement sur le smartphone
Interface de chatAucune incluseInterface de chat intégrée
Moteur d'inférenceGoogle LiteRT-LMBasé sur llama.cpp (modèles GGUF)
Format de modèle.litertlm uniquementGGUF
PlateformeAndroid uniquementAndroid et iOS
Serveur APIAPI HTTP compatible OpenAI, fonctionnalité centralePas une fonctionnalité centrale

Si vous voulez envoyer des requêtes depuis un ordinateur portable, un script ou un hub domotique vers un smartphone agissant comme serveur, OlliteRT est conçu pour cela. Si vous voulez discuter avec un modèle local directement sur l'écran du smartphone, une application orientée chat comme PocketPal AI convient mieux — voir l'avis PocketPal AI pour plus de détails.

À qui s'adresse OlliteRT ?

OlliteRT convient aux développeurs et amateurs qui veulent reconvertir un smartphone Android en serveur LLM dédié et entièrement local pour d'autres appareils, plutôt que de discuter avec un modèle sur le smartphone lui-même.

Pour quoi OlliteRT n'est pas adapté

OlliteRT n'est pas adapté si vous avez besoin d'une interface de chat, du support de modèles GGUF, du traitement de requêtes en parallèle, ou d'un historique de versions long et établi.

  • Pas une application de chat — elle n'a pas de fenêtre de chat intégrée ; elle ne répond qu'aux requêtes API HTTP d'autres logiciels
  • Pas compatible GGUF — fonctionne exclusivement avec des fichiers de modèle .litertlm, elle ne peut donc pas charger les modèles GGUF utilisés par llama.cpp, Ollama ou la plupart des autres outils LLM locaux sans une étape de conversion séparée
  • Pas conçue pour une charge simultanée — le README documente un seul modèle chargé traité séquentiellement, elle n'est donc pas conçue comme un serveur multi-utilisateur ou à haut débit
  • Pas compatible iOS — Android uniquement, et spécifiquement les appareils arm64-v8a
  • Pas une version 1.0 mature — le dépôt a environ cinq mois au moment de cet avis, et sa dernière version taguée (v0.9.6-beta.1) porte toujours une étiquette bêta

Erreurs courantes en évaluant OlliteRT

La plupart des confusions sur OlliteRT viennent du fait de supposer qu'il s'agit d'une application de chat, de confondre son format de modèle avec GGUF, ou de passer à côté de son statut de jeune projet.

Concurrents et alternatives

OlliteRT est le plus souvent comparé à d'autres applications LLM locales Android/mobiles — son principal facteur de différenciation est d'être un serveur headless compatible OpenAI plutôt qu'un client de chat sur le smartphone.

Outil
Connu pour
Lien
PocketPal AIApplication de chat sur l'appareil pour Android et iOS, modèles GGUF via llama.cppPocketPal AI avis
LaylaApplication de chat Android axée sur le jeu de rôle local et non censuré et l'usage assistantLayla avis
Google AI Edge GalleryL'application vitrine de Google pour les modèles embarqués via LiteRT/MediaPipeGoogle AI Edge Gallery avis
MLC ChatApplication de chat locale multiplateforme (Android/iOS) construite sur la pile de compilation MLC LLMMLC Chat avis

Cette liste reflète les outils couramment comparés à OlliteRT dans l'espace des LLM mobiles/embarqués, pas un classement indépendant de PromptQuorum — vérifiez les fonctionnalités actuelles et les formats de modèle pris en charge par chaque outil avant de choisir.

Questions fréquemment posées

Qu'est-ce qu'OlliteRT ?

OlliteRT (github.com/NightMean/OlliteRT) est une application Android gratuite et open source (Apache-2.0), créée par le développeur NightMean, qui transforme un smartphone en serveur d'inférence LLM entièrement local et compatible OpenAI grâce au moteur LiteRT-LM de Google.

OlliteRT dispose-t-il d'une interface de chat ?

Non. OlliteRT n'a pas de fenêtre de chat intégrée. C'est un serveur headless — vous interagissez avec lui via son API HTTP depuis un autre appareil ou une autre application, pas en tapant directement dans l'application.

OlliteRT est-il gratuit ?

Oui, OlliteRT est gratuit et open source sous licence Apache-2.0. Cet avis n'a trouvé aucune exigence de compte, d'abonnement ou d'achat intégré.

Quel format de modèle utilise OlliteRT ?

OlliteRT utilise exclusivement des fichiers de modèle .litertlm, pour le moteur d'exécution embarqué LiteRT-LM de Google. Il ne prend pas en charge GGUF, le format utilisé par les outils basés sur llama.cpp.

Quelles sont les exigences matérielles d'OlliteRT ?

Android 12 ou ultérieur sur un appareil arm64-v8a, avec un minimum de 6 Go de RAM (8 Go+ recommandé). Des modèles plus grands ou multimodaux, comme Gemma 4 E4B, nécessitent 12 Go de RAM ou plus, selon le README du projet.

OlliteRT fonctionne-t-il sans connexion Internet ?

L'inférence elle-même s'exécute entièrement sur l'appareil une fois un modèle téléchargé, aucune connexion Internet n'est donc nécessaire pour cela. Une connexion réseau locale est nécessaire pour que d'autres appareils atteignent le serveur API du smartphone, et un accès Internet est nécessaire pour télécharger initialement les modèles depuis HuggingFace.

OlliteRT peut-il traiter plusieurs requêtes à la fois ?

Non. Le README du projet documente qu'un seul modèle est chargé à la fois et que les requêtes sont traitées séquentiellement, pas en parallèle — il n'est pas conçu pour une charge simultanée multi-utilisateur.

OlliteRT est-il disponible sur iOS ?

Non, OlliteRT est réservé à Android, et nécessite spécifiquement un appareil arm64-v8a fonctionnant sous Android 12 ou ultérieur.

Comment installer OlliteRT ?

Téléchargez l'APK directement depuis la page des releases GitHub. Au moment de cet avis, elle n'est pas listée sur Google Play ni sur F-Droid.

OlliteRT est-il un projet mature et stable ?

Pas encore. Son dépôt GitHub a été créé en avril 2026, et sa dernière version taguée (v0.9.6-beta.1, juin 2026) porte toujours une étiquette bêta — considérez-le comme un projet pré-1.0 en développement actif.

Sources

← Retour aux LLM locaux avancés