Conclusiones clave
- OlliteRT (github.com/NightMean/OlliteRT) es una app Android gratuita y de código abierto que ejecuta LLMs localmente y los sirve por HTTP — no es una app de chat
- Creada por el desarrollador NightMean; el repositorio se creó el 6 de abril de 2026
- Con licencia Apache-2.0, confirmada mediante los metadatos de licencia del repositorio de GitHub
- Funciona por completo en el dispositivo mediante el runtime LiteRT-LM de Google, usando exclusivamente archivos de modelo
.litertlm— no admite GGUF - Expone una API HTTP compatible con OpenAI (chat completions, completions) además de endpoints compatibles con la API de mensajes de Anthropic, para que otros dispositivos de la red local la llamen
- Más de 350 estrellas y 47 forks en GitHub al momento de esta reseña; el último lanzamiento etiquetado es v0.9.6-beta.1 (6 de junio de 2026), por lo que el proyecto aún no ha alcanzado una versión 1.0
📍 En una frase
OlliteRT es una app Android gratuita y de código abierto (Apache-2.0), creada por el desarrollador NightMean, que convierte un teléfono en un servidor de inferencia de LLM totalmente local y compatible con OpenAI usando el runtime LiteRT-LM de Google, con más de 350 estrellas en GitHub al momento de esta reseña.
💬 En términos simples
En lugar de ejecutar una app de chat en tu teléfono, OlliteRT convierte el propio teléfono en un pequeño servidor: cargas un modelo en él, arrancas el servidor, y otros dispositivos de tu red doméstica —una laptop, un script, una herramienta de domótica— pueden enviarle texto y recibir una respuesta, de la misma forma en que hablarían con la API de OpenAI, salvo que todo se ejecuta en el teléfono.
📌Nota: Esta reseña se basa en el propio repositorio de GitHub, el README y el historial de versiones de OlliteRT. No afirma que PromptQuorum haya realizado benchmarks prácticos de rendimiento o consumo de batería en un modelo de teléfono específico.
¿Qué es OlliteRT?
OlliteRT es una aplicación Android que convierte el teléfono en el que se ejecuta en un servidor de inferencia de LLM local, descrita en su propia descripción del repositorio de GitHub como una forma de "convertir tu teléfono Android en un servidor de inferencia de LLM compatible con OpenAI, totalmente local, privado y de código abierto". No tiene ventana de chat propia; su propósito es ejecutar inferencia y responder solicitudes HTTP de otro software.
- Tipo de producto: una aplicación de servidor backend para Android, no un cliente de chat — no incluye interfaz de chat
- Creador: el desarrollador NightMean; el repositorio de GitHub está en github.com/NightMean/OlliteRT
- Repositorio creado el 6 de abril de 2026, según los metadatos del repositorio de GitHub — un proyecto joven al momento de esta reseña
- Licencia: Apache-2.0, confirmada mediante los metadatos de licencia del repositorio de GitHub
- Motor de inferencia: el runtime en el dispositivo LiteRT-LM de Google, la misma tecnología subyacente que Google usa para sus propias funciones de IA en el dispositivo en su herramientas Android
- Escala: más de 350 estrellas y 47 forks en GitHub al momento de esta reseña
Historia del proyecto y versiones clave
El repositorio de GitHub de OlliteRT se creó el 6 de abril de 2026, y desde entonces ha lanzado tres versiones etiquetadas previas a la 1.0, todas aún marcadas como beta.
- 16 de abril de 2026: se crea el repositorio
Why it matters: Marca el inicio del proyecto, según los metadatos del repositorio de GitHub. - 2v0.9.0-beta.1 — 24 de abril de 2026
Why it matters: El primer lanzamiento etiquetado encontrado en la página de releases de GitHub del proyecto. - 3v0.9.5-beta.1 — 30 de abril de 2026
Why it matters: Un lanzamiento beta de seguimiento aproximadamente una semana después de la primera etiqueta. - 4v0.9.6-beta.1 — 6 de junio de 2026
Why it matters: El lanzamiento etiquetado más reciente al momento de esta reseña; el proyecto todavía no ha lanzado una versión 1.0.
¿Qué hace realmente OlliteRT?
OlliteRT carga un archivo de modelo .litertlm en el teléfono, ejecuta la inferencia a través del runtime LiteRT-LM de Google usando la CPU y la GPU del propio teléfono, y sirve el resultado mediante una API HTTP compatible con OpenAI que otros dispositivos de la misma red pueden llamar.
- Inferencia en el dispositivo: usa exclusivamente el runtime LiteRT-LM de Google — sin respaldo en la nube, sin otro motor backend
- Formato de modelo: solo archivos
.litertlm; no admite GGUF, el formato usado por herramientas basadas en llama.cpp - Obtención de modelos: descargas con un solo toque directamente desde HuggingFace para los modelos compatibles, según el README del proyecto
- Compatibilidad de API: expone endpoints de chat completions y completions compatibles con OpenAI, además de endpoints compatibles con la API de mensajes de Anthropic, por HTTP en la red local
- Soporte multimodal: se admiten modelos de visión, audio y "razonamiento" (thinking) siempre que el modelo subyacente en sí admita esos modos, según el README
- Aceleración de hardware: ajustes configurables de aceleración por GPU o CPU para cada modelo
- Herramientas operativas: una herramienta de benchmarking integrada, registro de actividad con resaltado JSON, un panel de monitoreo del servidor, integración con métricas de Prometheus e integración con la API REST de Home Assistant
- Diseño de un solo modelo, secuencial: el README documenta que solo se carga un modelo a la vez y las solicitudes se procesan de forma secuencial, no en paralelo
Ejemplos de uso: dos formas de usar OlliteRT
Estos son flujos de trabajo concretos construidos a partir de las funciones documentadas del proyecto descritas arriba.
Instalar OlliteRT
OlliteRT se instala gratis como un APK desde GitHub releases, y su código fuente está en GitHub.
Fuente | Enlace |
|---|---|
| GitHub releases (descarga de APK) | github.com/NightMean/OlliteRT/releases |
| Repositorio GitHub (código fuente, Apache-2.0) | github.com/NightMean/OlliteRT |
Al momento de esta reseña, OlliteRT se distribuye solo mediante descarga directa de APK desde GitHub releases — esta reseña no encontró listado en Google Play ni en F-Droid. Requiere Android 12 o posterior en un dispositivo arm64-v8a. Instalar un APK fuera de Google Play requiere habilitar "instalar desde orígenes desconocidos" en los ajustes de Android; descarga el APK únicamente desde la página oficial de releases de GitHub.
Plataforma, precio y licencia
Plataforma
- Lo que indica OlliteRT:
- Solo Android (dispositivos arm64-v8a, Android 12+). Sin versión para iOS, escritorio ni web.
Costo
- Lo que indica OlliteRT:
- Gratis y de código abierto. No se encontró ninguna cuenta, suscripción ni compra dentro de la app en el README.
Licencia
- Lo que indica OlliteRT:
- Apache-2.0, confirmada mediante los metadatos de licencia del repositorio de GitHub.
Hardware mínimo
- Lo que indica OlliteRT:
- Mínimo 6 GB de RAM según el README; se recomiendan 8 GB+, y más para modelos multimodales o más grandes como Gemma 4 E4B (necesita 12 GB de RAM).
Método de instalación
- Lo que indica OlliteRT:
- Descarga directa de APK desde la página de GitHub releases; no se encontró listado en Google Play ni F-Droid al momento de esta reseña.
Verifica las recomendaciones de hardware actuales y la lista de modelos compatibles directamente en GitHub antes de elegir un teléfono o un modelo, ya que ambos pueden cambiar a medida que el proyecto (todavía previo a la 1.0) madura.
OlliteRT vs. PocketPal AI
OlliteRT y PocketPal AI ejecutan LLMs localmente en un teléfono, pero con propósitos distintos: OlliteRT es un servidor sin interfaz con el que hablan otros dispositivos, mientras que PocketPal AI es una app de chat que usas directamente en el propio teléfono.
Aspecto | OlliteRT | PocketPal AI |
|---|---|---|
| Uso principal | Servidor de inferencia sin interfaz para otros dispositivos de la red | App de chat en el dispositivo, usada directamente en el teléfono |
| Interfaz de chat | Ninguna incluida | Interfaz de chat incorporada |
| Motor de inferencia | Google LiteRT-LM | Basado en llama.cpp (modelos GGUF) |
| Formato de modelo | Solo .litertlm | GGUF |
| Plataforma | Solo Android | Android e iOS |
| Servidor API | API HTTP compatible con OpenAI, función principal | No es una función principal |
Si quieres enviar solicitudes desde una laptop, un script o un hub de domótica hacia un teléfono que actúa como servidor, OlliteRT está construido para eso. Si quieres chatear con un modelo local directamente en la pantalla del propio teléfono, una app centrada en el chat como PocketPal AI encaja mejor — consulta la reseña de PocketPal AI para más detalles.
¿Quién debería usar OlliteRT?
OlliteRT es adecuado para desarrolladores y aficionados que quieren reutilizar un teléfono Android como un servidor de LLM dedicado y totalmente local para otros dispositivos, en lugar de chatear con un modelo en el propio teléfono.
Para qué no sirve OlliteRT
OlliteRT no es adecuado si necesitas una interfaz de chat, soporte de modelos GGUF, manejo de solicitudes en paralelo, o un historial de lanzamientos largo y estable.
- No es una app de chat — no tiene ventana de chat propia; solo responde solicitudes de API HTTP de otro software
- No es compatible con GGUF — funciona exclusivamente con archivos de modelo
.litertlm, así que no puede cargar los modelos GGUF que usan llama.cpp, Ollama o la mayoría de las demás herramientas de LLM local sin un paso de conversión aparte - No está pensado para carga concurrente — el README documenta un solo modelo cargado y procesado secuencialmente, así que no está diseñado como servidor multiusuario o de alto rendimiento
- No es compatible con iOS — solo Android, y específicamente dispositivos arm64-v8a
- No es un lanzamiento 1.0 maduro — el repositorio tiene aproximadamente cinco meses al momento de esta reseña, y su versión etiquetada más reciente (v0.9.6-beta.1) todavía lleva la etiqueta beta
Errores comunes al evaluar OlliteRT
La mayor parte de la confusión sobre OlliteRT viene de asumir que es una app de chat, confundir su formato de modelo con GGUF, o pasar por alto que es un proyecto joven.
Competidores y alternativas
OlliteRT se compara más a menudo con otras apps de LLM local para Android/móviles — su principal diferencia es ser un servidor sin interfaz y compatible con OpenAI en vez de un cliente de chat en el teléfono.
Herramienta | Conocida por | Enlace |
|---|---|---|
| PocketPal AI | App de chat en el dispositivo para Android e iOS, modelos GGUF vía llama.cpp | Reseña de PocketPal AI |
| Layla | App de chat para Android enfocada en roleplay local sin censura y uso como asistente | Reseña de Layla |
| Google AI Edge Gallery | App de muestra propia de Google para modelos en el dispositivo vía LiteRT/MediaPipe | Reseña de Google AI Edge Gallery |
| MLC Chat | App de chat local multiplataforma (Android/iOS) construida sobre el stack compilador MLC LLM | Reseña de MLC Chat |
Esta lista refleja herramientas que se comparan comúnmente con OlliteRT en el espacio de LLM móvil/en el dispositivo, no un ranking independiente de PromptQuorum — verifica el conjunto de funciones y los formatos de modelo compatibles de cada herramienta antes de elegir.
Preguntas frecuentes
¿Qué es OlliteRT?
OlliteRT (github.com/NightMean/OlliteRT) es una app Android gratuita y de código abierto (Apache-2.0), creada por el desarrollador NightMean, que convierte un teléfono en un servidor de inferencia de LLM totalmente local y compatible con OpenAI usando el runtime LiteRT-LM de Google.
¿OlliteRT tiene interfaz de chat?
No. OlliteRT no tiene ventana de chat propia. Es un servidor sin interfaz — interactúas con él a través de su API HTTP desde otro dispositivo o aplicación, no escribiendo directamente en la app.
¿OlliteRT es gratuito?
Sí, OlliteRT es gratuito y de código abierto bajo la licencia Apache-2.0. Esta reseña no encontró requisito de cuenta, suscripción ni compra dentro de la app.
¿Qué formato de modelo usa OlliteRT?
OlliteRT usa exclusivamente archivos de modelo .litertlm, para el runtime en el dispositivo LiteRT-LM de Google. No admite GGUF, el formato usado por herramientas basadas en llama.cpp.
¿Cuáles son los requisitos de hardware de OlliteRT?
Android 12 o posterior en un dispositivo arm64-v8a, con un mínimo de 6 GB de RAM (8 GB+ recomendado). Los modelos multimodales o más grandes, como Gemma 4 E4B, necesitan 12 GB de RAM o más, según el README del proyecto.
¿OlliteRT funciona sin conexión a internet?
La inferencia en sí se ejecuta por completo en el dispositivo una vez descargado un modelo, así que no se necesita conexión a internet para eso. Se necesita una conexión de red local para que otros dispositivos alcancen el servidor API del teléfono, y se necesita acceso a internet para descargar inicialmente los modelos desde HuggingFace.
¿OlliteRT puede manejar múltiples solicitudes a la vez?
No. El README del proyecto documenta que solo se carga un modelo a la vez y las solicitudes se procesan de forma secuencial, no en paralelo — no está diseñado para carga concurrente o multiusuario.
¿OlliteRT está disponible en iOS?
No, OlliteRT es solo para Android, y específicamente requiere un dispositivo arm64-v8a con Android 12 o posterior.
¿Cómo instalo OlliteRT?
Descarga el APK directamente desde la página de GitHub releases. Al momento de esta reseña, no está listado en Google Play ni en F-Droid.
¿OlliteRT es un proyecto maduro y estable?
Todavía no. Su repositorio de GitHub se creó en abril de 2026, y su lanzamiento etiquetado más reciente (v0.9.6-beta.1, junio de 2026) todavía lleva la etiqueta beta — considéralo un proyecto en desarrollo activo, previo a la versión 1.0.