Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/OlliteRT im Test: Android-Smartphone als lokaler LLM-Server
Mobile & Edge LLMs

OlliteRT im Test: Android-Smartphone als lokaler LLM-Server

·10 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

OlliteRT ist eine kostenlose, quelloffene Android-App, die ein Smartphone in einen vollständig lokalen, OpenAI-kompatiblen LLM-Inferenzserver verwandelt, von ihrem eigenen Entwickler als „Ollama für Android“ beschrieben. Sie führt Modelle vollständig auf dem Gerät über Googles LiteRT-LM-Laufzeit mit .litertlm-Modelldateien aus, stellt Chat-Completions- und Anthropic-Messages-kompatible HTTP-Endpunkte im lokalen Netzwerk bereit und hat keine eigene Chat-Oberfläche – sie ist ein Backend, mit dem andere Apps oder Geräte sich verbinden.

OlliteRT (github.com/NightMean/OlliteRT) ist eine kostenlose, quelloffene Android-App von Entwickler NightMean, die ein Smartphone in einen vollständig lokalen, OpenAI-kompatiblen LLM-Inferenzserver verwandelt. Sie läuft vollständig auf Googles LiteRT-LM-On-Device-Laufzeitumgebung, benötigt .litertlm-Modelldateien und hat keine eigene Chat-Oberfläche – andere Geräte im selben Netzwerk kommunizieren per HTTP damit. Dieser Test zeigt genau, was die App tut, welche Hardware nötig ist und für wen sie geeignet ist.

Wichtigste Erkenntnisse

  • OlliteRT (github.com/NightMean/OlliteRT) ist eine kostenlose, quelloffene Android-App, die LLMs lokal ausführt und über HTTP bereitstellt – keine Chat-App
  • Erstellt von Entwickler NightMean; Repository erstellt am 6. April 2026
  • Apache-2.0-lizenziert, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys
  • Läuft vollständig auf dem Gerät über Googles LiteRT-LM-Laufzeit, verwendet ausschließlich .litertlm-Modelldateien – unterstützt kein GGUF
  • Stellt eine OpenAI-kompatible HTTP-API (Chat Completions, Completions) sowie Anthropic-Messages-API-kompatible Endpunkte für andere Geräte im lokalen Netzwerk bereit
  • Über 350 GitHub-Stars und 47 Forks zum Zeitpunkt dieses Tests; aktuellstes getaggtes Release ist v0.9.6-beta.1 (6. Juni 2026), das Projekt hat also noch kein 1.0-Release erreicht

📍 In einem Satz

OlliteRT ist eine kostenlose, quelloffene (Apache-2.0) Android-App von Entwickler NightMean, die ein Smartphone über Googles LiteRT-LM-Laufzeit in einen vollständig lokalen, OpenAI-kompatiblen LLM-Inferenzserver verwandelt, mit über 350 GitHub-Stars zum Zeitpunkt dieses Tests.

💬 In einfachen Worten

Statt eine Chat-App auf Ihrem Smartphone auszuführen, verwandelt OlliteRT das Smartphone selbst in einen kleinen Server: Sie laden ein Modell darauf, starten den Server, und andere Geräte in Ihrem Heimnetzwerk – ein Laptop, ein Skript, ein Smart-Home-Tool – können ihm Text senden und eine Antwort zurückbekommen, genauso wie sie mit OpenAIs API sprechen würden, nur dass alles auf dem Smartphone läuft.

📌Hinweis: Dieser Test basiert auf dem eigenen GitHub-Repository, der README und der Release-Historie von OlliteRT. PromptQuorum behauptet nicht, eigene Durchsatz- oder Akkuverbrauchstests auf einem bestimmten Smartphone-Modell durchgeführt zu haben.

Was ist OlliteRT?

OlliteRT ist eine Android-Anwendung, die das Smartphone, auf dem sie läuft, in einen lokalen LLM-Inferenzserver verwandelt, beschrieben in der eigenen GitHub-Repository-Beschreibung als eine Möglichkeit, „Ihr Android-Smartphone in einen OpenAI-kompatiblen LLM-Inferenzserver zu verwandeln – vollständig lokal, privat und Open Source“. Sie hat kein eigenes Chat-Fenster; ihr Zweck ist es, Inferenz auszuführen und HTTP-Anfragen von anderer Software zu beantworten.

  • Produkttyp: eine Android-Backend-Server-Anwendung, kein Chat-Client – keine Chat-Oberfläche enthalten
  • Ersteller: Entwickler NightMean; das GitHub-Repository liegt unter github.com/NightMean/OlliteRT
  • Repository erstellt am 6. April 2026, laut den Repository-Metadaten von GitHub – ein junges Projekt zum Zeitpunkt dieses Tests
  • Lizenz: Apache-2.0, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys
  • Inferenz-Engine: Googles LiteRT-LM-On-Device-Laufzeitumgebung, dieselbe zugrunde liegende Technologie, die Google für On-Device-KI-Funktionen in seinen eigenen Android-Tools nutzt
  • Umfang: über 350 GitHub-Stars und 47 Forks zum Zeitpunkt dieses Tests

Projektgeschichte und Versionsmeilensteine

Das GitHub-Repository von OlliteRT wurde am 6. April 2026 erstellt, und seitdem sind drei getaggte Pre-1.0-Releases erschienen, alle noch als Beta gekennzeichnet.

  1. 1
    6. April 2026: Repository erstellt
    Why it matters: Markiert den Start des Projekts, laut den Repository-Metadaten von GitHub.
  2. 2
    v0.9.0-beta.1 — 24. April 2026
    Why it matters: Der erste getaggte Release auf der GitHub-Releases-Seite des Projekts.
  3. 3
    v0.9.5-beta.1 — 30. April 2026
    Why it matters: Ein Folge-Beta-Release etwa eine Woche nach dem ersten Tag.
  4. 4
    v0.9.6-beta.1 — 6. Juni 2026
    Why it matters: Das aktuellste getaggte Release zum Zeitpunkt dieses Tests; das Projekt hat noch kein 1.0 veröffentlicht.

Was macht OlliteRT tatsächlich?

OlliteRT lädt eine .litertlm-Modelldatei auf dem Smartphone, führt Inferenz über Googles LiteRT-LM-Laufzeit mit der eigenen CPU und GPU des Smartphones aus und stellt das Ergebnis über eine OpenAI-kompatible HTTP-API bereit, die andere Geräte im selben Netzwerk aufrufen können.

  • On-Device-Inferenz: nutzt ausschließlich Googles LiteRT-LM-Laufzeit – kein Cloud-Fallback, keine andere Backend-Engine
  • Modellformat: ausschließlich .litertlm-Dateien; unterstützt kein GGUF, das Format, das llama.cpp-basierte Tools verwenden
  • Modellbeschaffung: Ein-Klick-Downloads direkt von HuggingFace für unterstützte Modelle, laut Projekt-README
  • API-Kompatibilität: stellt OpenAI-kompatible Chat-Completions- und Completions-Endpunkte sowie Anthropic-Messages-API-kompatible Endpunkte über HTTP im lokalen Netzwerk bereit
  • Multimodale Unterstützung: Vision-, Audio- und „Denk“-(Reasoning-)Modelle werden unterstützt, sofern das zugrunde liegende Modell selbst diese Modi unterstützt, laut README
  • Hardware-Beschleunigung: konfigurierbare GPU- oder CPU-Beschleunigungseinstellungen pro Modell
  • Betriebswerkzeuge: ein integriertes Benchmarking-Tool, Aktivitätsprotokollierung mit JSON-Hervorhebung, ein Server-Monitoring-Dashboard, Prometheus-Metrik-Integration und eine Home-Assistant-REST-API-Integration
  • Einzelmodell-, sequenzielles Design: Die README dokumentiert, dass jeweils nur ein Modell geladen ist und Anfragen sequenziell, nicht parallel, verarbeitet werden

Anwendungsbeispiele: Zwei Wege, OlliteRT zu nutzen

Dies sind konkrete Arbeitsabläufe, die auf den oben dokumentierten Funktionen des Projekts basieren.

Plattform, Preise und Lizenzierung

Plattform

Was OlliteRT angibt:
Nur Android (arm64-v8a-Geräte, Android 12+). Keine iOS-, Desktop- oder Web-Version.

Kosten

Was OlliteRT angibt:
Kostenlos und quelloffen. Kein Konto, Abonnement oder In-App-Kauf in der README gefunden.

Lizenzierung

Was OlliteRT angibt:
Apache-2.0, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys.

Hardware-Minimum

Was OlliteRT angibt:
Mindestens 6 GB RAM laut README; 8 GB+ empfohlen, mehr für größere oder multimodale Modelle wie Gemma 4 E4B (benötigt 12 GB RAM).

Installationsmethode

Was OlliteRT angibt:
Direkter APK-Download von der GitHub-Releases-Seite; kein Google-Play- oder F-Droid-Eintrag zum Zeitpunkt dieses Tests gefunden.

Prüfen Sie aktuelle Hardware-Empfehlungen und die Liste unterstützter Modelle direkt auf GitHub, bevor Sie ein Smartphone oder Modell auswählen, da sich beides ändern kann, während das (noch nicht 1.0) Projekt reift.

OlliteRT vs. PocketPal AI

OlliteRT und PocketPal AI führen beide LLMs lokal auf einem Smartphone aus, aber für unterschiedliche Zwecke: OlliteRT ist ein Headless-Server, mit dem andere Geräte kommunizieren, während PocketPal AI eine Chat-App ist, die Sie direkt auf dem Smartphone selbst nutzen.

Aspekt
OlliteRT
PocketPal AI
HauptzweckHeadless-Inferenzserver für andere Geräte im NetzwerkOn-Device-Chat-App, direkt auf dem Smartphone genutzt
Chat-OberflächeKeine enthaltenIntegrierte Chat-Oberfläche
Inferenz-EngineGoogle LiteRT-LMllama.cpp-basiert (GGUF-Modelle)
ModellformatNur .litertlmGGUF
PlattformNur AndroidAndroid und iOS
API-ServerOpenAI-kompatible HTTP-API, KernfunktionKeine Kernfunktion

Wenn Sie Anfragen von einem Laptop, Skript oder Smart-Home-Hub an ein Smartphone senden wollen, das als Server fungiert, ist OlliteRT dafür gebaut. Wenn Sie direkt auf dem Bildschirm des Smartphones mit einem lokalen Modell chatten wollen, passt eine chat-orientierte App wie PocketPal AI besser – Details im PocketPal-AI-Test.

Für wen eignet sich OlliteRT?

OlliteRT eignet sich für Entwickler und Hobbyisten, die ein Android-Smartphone als dedizierten, vollständig lokalen LLM-Server für andere Geräte umfunktionieren wollen, statt auf dem Smartphone selbst mit einem Modell zu chatten.

Wofür OlliteRT nicht geeignet ist

OlliteRT eignet sich nicht, wenn Sie eine Chat-Oberfläche, GGUF-Modellunterstützung, parallele Anfrageverarbeitung oder eine lange etablierte, stabile Release-Historie benötigen.

  • Keine Chat-App – sie hat kein integriertes Chat-Fenster; sie beantwortet nur HTTP-API-Anfragen anderer Software
  • Nicht GGUF-kompatibel – funktioniert ausschließlich mit .litertlm-Modelldateien, kann also die GGUF-Modelle, die llama.cpp, Ollama oder die meisten anderen lokalen LLM-Tools nutzen, ohne separaten Konvertierungsschritt nicht laden
  • Nicht für gleichzeitige Last gebaut – die README dokumentiert ein einzelnes geladenes Modell, das sequenziell verarbeitet wird, also nicht als Mehrbenutzer- oder Hochdurchsatz-Server konzipiert
  • Nicht iOS-kompatibel – nur Android, und speziell arm64-v8a-Geräte
  • Kein ausgereiftes 1.0-Release – das Repository ist zum Zeitpunkt dieses Tests etwa fünf Monate alt, und seine aktuellste getaggte Version (v0.9.6-beta.1) trägt noch ein Beta-Label

Häufige Fehler bei der Bewertung von OlliteRT

Die meiste Verwirrung über OlliteRT entsteht durch die Annahme, es handele sich um eine Chat-App, durch die Verwechslung seines Modellformats mit GGUF, oder durch das Übersehen seines jungen Projektstatus.

Konkurrenten und Alternativen

OlliteRT wird am häufigsten mit anderen Android-/Mobile-Apps für lokale LLMs verglichen – sein Hauptunterscheidungsmerkmal ist, ein Headless-, OpenAI-kompatibler Server statt eines Chat-Clients auf dem Smartphone zu sein.

Tool
Bekannt für
Link
PocketPal AIOn-Device-Chat-App für Android und iOS, GGUF-Modelle via llama.cppPocketPal AI Review
LaylaAndroid-Chat-App mit Fokus auf lokales, unzensiertes Rollenspiel und AssistenznutzungLayla Review
Google AI Edge GalleryGoogles eigene Showcase-App für On-Device-Modelle via LiteRT/MediaPipeGoogle AI Edge Gallery Review
MLC ChatPlattformübergreifende (Android/iOS) lokale Chat-App auf Basis des MLC-LLM-Compiler-StacksMLC Chat Review

Diese Liste zeigt Tools, die üblicherweise mit OlliteRT im Bereich mobiler/On-Device-LLMs verglichen werden, kein unabhängiges PromptQuorum-Ranking – prüfen Sie den aktuellen Funktionsumfang und die unterstützten Modellformate jedes Tools, bevor Sie sich entscheiden.

Häufig gestellte Fragen

Was ist OlliteRT?

OlliteRT (github.com/NightMean/OlliteRT) ist eine kostenlose, quelloffene (Apache-2.0) Android-App von Entwickler NightMean, die ein Smartphone über Googles LiteRT-LM-Laufzeit in einen vollständig lokalen, OpenAI-kompatiblen LLM-Inferenzserver verwandelt.

Hat OlliteRT eine Chat-Oberfläche?

Nein. OlliteRT hat kein integriertes Chat-Fenster. Es ist ein Headless-Server – Sie interagieren über dessen HTTP-API von einem anderen Gerät oder einer Anwendung aus damit, nicht indem Sie direkt in die App tippen.

Ist OlliteRT kostenlos?

Ja, OlliteRT ist kostenlos und quelloffen unter der Apache-2.0-Lizenz. Dieser Test fand kein Konto-, Abonnement- oder In-App-Kauf-Erfordernis.

Welches Modellformat verwendet OlliteRT?

OlliteRT verwendet ausschließlich .litertlm-Modelldateien für Googles LiteRT-LM-On-Device-Laufzeit. Es unterstützt kein GGUF, das Format, das llama.cpp-basierte Tools verwenden.

Welche Hardware-Anforderungen hat OlliteRT?

Android 12 oder neuer auf einem arm64-v8a-Gerät, mit mindestens 6 GB RAM (8 GB+ empfohlen). Größere oder multimodale Modelle wie Gemma 4 E4B benötigen laut Projekt-README 12 GB RAM oder mehr.

Funktioniert OlliteRT ohne Internetverbindung?

Die Inferenz selbst läuft vollständig auf dem Gerät, sobald ein Modell heruntergeladen ist, dafür ist also keine Internetverbindung nötig. Eine lokale Netzwerkverbindung wird benötigt, damit andere Geräte den API-Server des Smartphones erreichen, und Internetzugang wird benötigt, um Modelle anfangs von HuggingFace herunterzuladen.

Kann OlliteRT mehrere Anfragen gleichzeitig verarbeiten?

Nein. Die Projekt-README dokumentiert, dass jeweils nur ein Modell geladen ist und Anfragen sequenziell, nicht parallel, verarbeitet werden – es ist nicht für gleichzeitige Mehrbenutzer-Last konzipiert.

Ist OlliteRT auf iOS verfügbar?

Nein, OlliteRT ist nur für Android und benötigt speziell ein arm64-v8a-Gerät mit Android 12 oder neuer.

Wie installiere ich OlliteRT?

Laden Sie die APK direkt von der GitHub-Releases-Seite herunter. Zum Zeitpunkt dieses Tests ist sie nicht im Google Play Store oder auf F-Droid gelistet.

Ist OlliteRT ein ausgereiftes, stabiles Projekt?

Noch nicht. Sein GitHub-Repository wurde im April 2026 erstellt, und sein aktuellstes getaggtes Release (v0.9.6-beta.1, Juni 2026) trägt noch ein Beta-Label – behandeln Sie es als aktiv in Entwicklung befindliches Pre-1.0-Projekt.

Quellen

← Zurück zu Lokale LLMs Pro