Wichtigste Erkenntnisse
- OlliteRT (github.com/NightMean/OlliteRT) ist eine kostenlose, quelloffene Android-App, die LLMs lokal ausführt und über HTTP bereitstellt – keine Chat-App
- Erstellt von Entwickler NightMean; Repository erstellt am 6. April 2026
- Apache-2.0-lizenziert, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys
- Läuft vollständig auf dem Gerät über Googles LiteRT-LM-Laufzeit, verwendet ausschließlich
.litertlm-Modelldateien – unterstützt kein GGUF - Stellt eine OpenAI-kompatible HTTP-API (Chat Completions, Completions) sowie Anthropic-Messages-API-kompatible Endpunkte für andere Geräte im lokalen Netzwerk bereit
- Über 350 GitHub-Stars und 47 Forks zum Zeitpunkt dieses Tests; aktuellstes getaggtes Release ist v0.9.6-beta.1 (6. Juni 2026), das Projekt hat also noch kein 1.0-Release erreicht
📍 In einem Satz
OlliteRT ist eine kostenlose, quelloffene (Apache-2.0) Android-App von Entwickler NightMean, die ein Smartphone über Googles LiteRT-LM-Laufzeit in einen vollständig lokalen, OpenAI-kompatiblen LLM-Inferenzserver verwandelt, mit über 350 GitHub-Stars zum Zeitpunkt dieses Tests.
💬 In einfachen Worten
Statt eine Chat-App auf Ihrem Smartphone auszuführen, verwandelt OlliteRT das Smartphone selbst in einen kleinen Server: Sie laden ein Modell darauf, starten den Server, und andere Geräte in Ihrem Heimnetzwerk – ein Laptop, ein Skript, ein Smart-Home-Tool – können ihm Text senden und eine Antwort zurückbekommen, genauso wie sie mit OpenAIs API sprechen würden, nur dass alles auf dem Smartphone läuft.
📌Hinweis: Dieser Test basiert auf dem eigenen GitHub-Repository, der README und der Release-Historie von OlliteRT. PromptQuorum behauptet nicht, eigene Durchsatz- oder Akkuverbrauchstests auf einem bestimmten Smartphone-Modell durchgeführt zu haben.
Was ist OlliteRT?
OlliteRT ist eine Android-Anwendung, die das Smartphone, auf dem sie läuft, in einen lokalen LLM-Inferenzserver verwandelt, beschrieben in der eigenen GitHub-Repository-Beschreibung als eine Möglichkeit, „Ihr Android-Smartphone in einen OpenAI-kompatiblen LLM-Inferenzserver zu verwandeln – vollständig lokal, privat und Open Source“. Sie hat kein eigenes Chat-Fenster; ihr Zweck ist es, Inferenz auszuführen und HTTP-Anfragen von anderer Software zu beantworten.
- Produkttyp: eine Android-Backend-Server-Anwendung, kein Chat-Client – keine Chat-Oberfläche enthalten
- Ersteller: Entwickler NightMean; das GitHub-Repository liegt unter github.com/NightMean/OlliteRT
- Repository erstellt am 6. April 2026, laut den Repository-Metadaten von GitHub – ein junges Projekt zum Zeitpunkt dieses Tests
- Lizenz: Apache-2.0, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys
- Inferenz-Engine: Googles LiteRT-LM-On-Device-Laufzeitumgebung, dieselbe zugrunde liegende Technologie, die Google für On-Device-KI-Funktionen in seinen eigenen Android-Tools nutzt
- Umfang: über 350 GitHub-Stars und 47 Forks zum Zeitpunkt dieses Tests
Projektgeschichte und Versionsmeilensteine
Das GitHub-Repository von OlliteRT wurde am 6. April 2026 erstellt, und seitdem sind drei getaggte Pre-1.0-Releases erschienen, alle noch als Beta gekennzeichnet.
- 16. April 2026: Repository erstellt
Why it matters: Markiert den Start des Projekts, laut den Repository-Metadaten von GitHub. - 2v0.9.0-beta.1 — 24. April 2026
Why it matters: Der erste getaggte Release auf der GitHub-Releases-Seite des Projekts. - 3v0.9.5-beta.1 — 30. April 2026
Why it matters: Ein Folge-Beta-Release etwa eine Woche nach dem ersten Tag. - 4v0.9.6-beta.1 — 6. Juni 2026
Why it matters: Das aktuellste getaggte Release zum Zeitpunkt dieses Tests; das Projekt hat noch kein 1.0 veröffentlicht.
Was macht OlliteRT tatsächlich?
OlliteRT lädt eine .litertlm-Modelldatei auf dem Smartphone, führt Inferenz über Googles LiteRT-LM-Laufzeit mit der eigenen CPU und GPU des Smartphones aus und stellt das Ergebnis über eine OpenAI-kompatible HTTP-API bereit, die andere Geräte im selben Netzwerk aufrufen können.
- On-Device-Inferenz: nutzt ausschließlich Googles LiteRT-LM-Laufzeit – kein Cloud-Fallback, keine andere Backend-Engine
- Modellformat: ausschließlich
.litertlm-Dateien; unterstützt kein GGUF, das Format, das llama.cpp-basierte Tools verwenden - Modellbeschaffung: Ein-Klick-Downloads direkt von HuggingFace für unterstützte Modelle, laut Projekt-README
- API-Kompatibilität: stellt OpenAI-kompatible Chat-Completions- und Completions-Endpunkte sowie Anthropic-Messages-API-kompatible Endpunkte über HTTP im lokalen Netzwerk bereit
- Multimodale Unterstützung: Vision-, Audio- und „Denk“-(Reasoning-)Modelle werden unterstützt, sofern das zugrunde liegende Modell selbst diese Modi unterstützt, laut README
- Hardware-Beschleunigung: konfigurierbare GPU- oder CPU-Beschleunigungseinstellungen pro Modell
- Betriebswerkzeuge: ein integriertes Benchmarking-Tool, Aktivitätsprotokollierung mit JSON-Hervorhebung, ein Server-Monitoring-Dashboard, Prometheus-Metrik-Integration und eine Home-Assistant-REST-API-Integration
- Einzelmodell-, sequenzielles Design: Die README dokumentiert, dass jeweils nur ein Modell geladen ist und Anfragen sequenziell, nicht parallel, verarbeitet werden
Anwendungsbeispiele: Zwei Wege, OlliteRT zu nutzen
Dies sind konkrete Arbeitsabläufe, die auf den oben dokumentierten Funktionen des Projekts basieren.
OlliteRT installieren
OlliteRT wird kostenlos als APK von den GitHub-Releases installiert, der Quellcode liegt auf GitHub.
Quelle | Link |
|---|---|
| GitHub-Releases (APK-Download) | github.com/NightMean/OlliteRT/releases |
| GitHub-Repository (Quellcode, Apache-2.0) | github.com/NightMean/OlliteRT |
Zum Zeitpunkt dieses Tests wird OlliteRT nur über direkten APK-Download von den GitHub-Releases verteilt – dieser Test fand keinen Eintrag im Google Play Store oder auf F-Droid. Erfordert Android 12 oder neuer auf einem arm64-v8a-Gerät. Die Installation einer APK außerhalb von Google Play erfordert die Aktivierung von „Installation aus unbekannten Quellen“ in den Android-Einstellungen; laden Sie die APK nur von der offiziellen GitHub-Releases-Seite herunter.
Plattform, Preise und Lizenzierung
Plattform
- Was OlliteRT angibt:
- Nur Android (arm64-v8a-Geräte, Android 12+). Keine iOS-, Desktop- oder Web-Version.
Kosten
- Was OlliteRT angibt:
- Kostenlos und quelloffen. Kein Konto, Abonnement oder In-App-Kauf in der README gefunden.
Lizenzierung
- Was OlliteRT angibt:
- Apache-2.0, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys.
Hardware-Minimum
- Was OlliteRT angibt:
- Mindestens 6 GB RAM laut README; 8 GB+ empfohlen, mehr für größere oder multimodale Modelle wie Gemma 4 E4B (benötigt 12 GB RAM).
Installationsmethode
- Was OlliteRT angibt:
- Direkter APK-Download von der GitHub-Releases-Seite; kein Google-Play- oder F-Droid-Eintrag zum Zeitpunkt dieses Tests gefunden.
Prüfen Sie aktuelle Hardware-Empfehlungen und die Liste unterstützter Modelle direkt auf GitHub, bevor Sie ein Smartphone oder Modell auswählen, da sich beides ändern kann, während das (noch nicht 1.0) Projekt reift.
OlliteRT vs. PocketPal AI
OlliteRT und PocketPal AI führen beide LLMs lokal auf einem Smartphone aus, aber für unterschiedliche Zwecke: OlliteRT ist ein Headless-Server, mit dem andere Geräte kommunizieren, während PocketPal AI eine Chat-App ist, die Sie direkt auf dem Smartphone selbst nutzen.
Aspekt | OlliteRT | PocketPal AI |
|---|---|---|
| Hauptzweck | Headless-Inferenzserver für andere Geräte im Netzwerk | On-Device-Chat-App, direkt auf dem Smartphone genutzt |
| Chat-Oberfläche | Keine enthalten | Integrierte Chat-Oberfläche |
| Inferenz-Engine | Google LiteRT-LM | llama.cpp-basiert (GGUF-Modelle) |
| Modellformat | Nur .litertlm | GGUF |
| Plattform | Nur Android | Android und iOS |
| API-Server | OpenAI-kompatible HTTP-API, Kernfunktion | Keine Kernfunktion |
Wenn Sie Anfragen von einem Laptop, Skript oder Smart-Home-Hub an ein Smartphone senden wollen, das als Server fungiert, ist OlliteRT dafür gebaut. Wenn Sie direkt auf dem Bildschirm des Smartphones mit einem lokalen Modell chatten wollen, passt eine chat-orientierte App wie PocketPal AI besser – Details im PocketPal-AI-Test.
Für wen eignet sich OlliteRT?
OlliteRT eignet sich für Entwickler und Hobbyisten, die ein Android-Smartphone als dedizierten, vollständig lokalen LLM-Server für andere Geräte umfunktionieren wollen, statt auf dem Smartphone selbst mit einem Modell zu chatten.
Wofür OlliteRT nicht geeignet ist
OlliteRT eignet sich nicht, wenn Sie eine Chat-Oberfläche, GGUF-Modellunterstützung, parallele Anfrageverarbeitung oder eine lange etablierte, stabile Release-Historie benötigen.
- Keine Chat-App – sie hat kein integriertes Chat-Fenster; sie beantwortet nur HTTP-API-Anfragen anderer Software
- Nicht GGUF-kompatibel – funktioniert ausschließlich mit
.litertlm-Modelldateien, kann also die GGUF-Modelle, die llama.cpp, Ollama oder die meisten anderen lokalen LLM-Tools nutzen, ohne separaten Konvertierungsschritt nicht laden - Nicht für gleichzeitige Last gebaut – die README dokumentiert ein einzelnes geladenes Modell, das sequenziell verarbeitet wird, also nicht als Mehrbenutzer- oder Hochdurchsatz-Server konzipiert
- Nicht iOS-kompatibel – nur Android, und speziell arm64-v8a-Geräte
- Kein ausgereiftes 1.0-Release – das Repository ist zum Zeitpunkt dieses Tests etwa fünf Monate alt, und seine aktuellste getaggte Version (v0.9.6-beta.1) trägt noch ein Beta-Label
Häufige Fehler bei der Bewertung von OlliteRT
Die meiste Verwirrung über OlliteRT entsteht durch die Annahme, es handele sich um eine Chat-App, durch die Verwechslung seines Modellformats mit GGUF, oder durch das Übersehen seines jungen Projektstatus.
Konkurrenten und Alternativen
OlliteRT wird am häufigsten mit anderen Android-/Mobile-Apps für lokale LLMs verglichen – sein Hauptunterscheidungsmerkmal ist, ein Headless-, OpenAI-kompatibler Server statt eines Chat-Clients auf dem Smartphone zu sein.
Tool | Bekannt für | Link |
|---|---|---|
| PocketPal AI | On-Device-Chat-App für Android und iOS, GGUF-Modelle via llama.cpp | PocketPal AI Review |
| Layla | Android-Chat-App mit Fokus auf lokales, unzensiertes Rollenspiel und Assistenznutzung | Layla Review |
| Google AI Edge Gallery | Googles eigene Showcase-App für On-Device-Modelle via LiteRT/MediaPipe | Google AI Edge Gallery Review |
| MLC Chat | Plattformübergreifende (Android/iOS) lokale Chat-App auf Basis des MLC-LLM-Compiler-Stacks | MLC Chat Review |
Diese Liste zeigt Tools, die üblicherweise mit OlliteRT im Bereich mobiler/On-Device-LLMs verglichen werden, kein unabhängiges PromptQuorum-Ranking – prüfen Sie den aktuellen Funktionsumfang und die unterstützten Modellformate jedes Tools, bevor Sie sich entscheiden.
Häufig gestellte Fragen
Was ist OlliteRT?
OlliteRT (github.com/NightMean/OlliteRT) ist eine kostenlose, quelloffene (Apache-2.0) Android-App von Entwickler NightMean, die ein Smartphone über Googles LiteRT-LM-Laufzeit in einen vollständig lokalen, OpenAI-kompatiblen LLM-Inferenzserver verwandelt.
Hat OlliteRT eine Chat-Oberfläche?
Nein. OlliteRT hat kein integriertes Chat-Fenster. Es ist ein Headless-Server – Sie interagieren über dessen HTTP-API von einem anderen Gerät oder einer Anwendung aus damit, nicht indem Sie direkt in die App tippen.
Ist OlliteRT kostenlos?
Ja, OlliteRT ist kostenlos und quelloffen unter der Apache-2.0-Lizenz. Dieser Test fand kein Konto-, Abonnement- oder In-App-Kauf-Erfordernis.
Welches Modellformat verwendet OlliteRT?
OlliteRT verwendet ausschließlich .litertlm-Modelldateien für Googles LiteRT-LM-On-Device-Laufzeit. Es unterstützt kein GGUF, das Format, das llama.cpp-basierte Tools verwenden.
Welche Hardware-Anforderungen hat OlliteRT?
Android 12 oder neuer auf einem arm64-v8a-Gerät, mit mindestens 6 GB RAM (8 GB+ empfohlen). Größere oder multimodale Modelle wie Gemma 4 E4B benötigen laut Projekt-README 12 GB RAM oder mehr.
Funktioniert OlliteRT ohne Internetverbindung?
Die Inferenz selbst läuft vollständig auf dem Gerät, sobald ein Modell heruntergeladen ist, dafür ist also keine Internetverbindung nötig. Eine lokale Netzwerkverbindung wird benötigt, damit andere Geräte den API-Server des Smartphones erreichen, und Internetzugang wird benötigt, um Modelle anfangs von HuggingFace herunterzuladen.
Kann OlliteRT mehrere Anfragen gleichzeitig verarbeiten?
Nein. Die Projekt-README dokumentiert, dass jeweils nur ein Modell geladen ist und Anfragen sequenziell, nicht parallel, verarbeitet werden – es ist nicht für gleichzeitige Mehrbenutzer-Last konzipiert.
Ist OlliteRT auf iOS verfügbar?
Nein, OlliteRT ist nur für Android und benötigt speziell ein arm64-v8a-Gerät mit Android 12 oder neuer.
Wie installiere ich OlliteRT?
Laden Sie die APK direkt von der GitHub-Releases-Seite herunter. Zum Zeitpunkt dieses Tests ist sie nicht im Google Play Store oder auf F-Droid gelistet.
Ist OlliteRT ein ausgereiftes, stabiles Projekt?
Noch nicht. Sein GitHub-Repository wurde im April 2026 erstellt, und sein aktuellstes getaggtes Release (v0.9.6-beta.1, Juni 2026) trägt noch ein Beta-Label – behandeln Sie es als aktiv in Entwicklung befindliches Pre-1.0-Projekt.