Skip to main content
PromptQuorum
Início/LLMs locais avançados/Análise do OlliteRT: transforme um celular Android em um servidor de LLM local
Mobile & Edge LLMs

Análise do OlliteRT: transforme um celular Android em um servidor de LLM local

·10 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O OlliteRT é um aplicativo Android gratuito e de código aberto que transforma um celular em um servidor de inferência de LLM totalmente local e compatível com a OpenAI, descrito pelo seu próprio criador como "Ollama para Android". Ele roda os modelos inteiramente no dispositivo via runtime LiteRT-LM do Google usando arquivos de modelo .litertlm, expõe endpoints HTTP compatíveis com chat completions da OpenAI e com a API de mensagens da Anthropic na rede local, e vem sem interface de chat própria — é um backend ao qual outros apps ou dispositivos se conectam.

O OlliteRT (github.com/NightMean/OlliteRT) é um aplicativo Android gratuito e de código aberto, criado pelo desenvolvedor NightMean, que transforma um celular em um servidor de inferência de LLM totalmente local e compatível com a OpenAI. Ele roda inteiramente sobre o runtime no dispositivo LiteRT-LM do Google, exige arquivos de modelo .litertlm e não tem interface de chat própria — outros dispositivos na mesma rede se comunicam com ele via HTTP. Esta análise mostra exatamente o que ele faz, seus requisitos de hardware e para quem ele é indicado.

Principais conclusões

  • O OlliteRT (github.com/NightMean/OlliteRT) é um aplicativo Android gratuito e de código aberto que roda LLMs localmente e os serve via HTTP — não é um app de chat
  • Criado pelo desenvolvedor NightMean; repositório criado em 6 de abril de 2026
  • Licenciado sob Apache-2.0, confirmado nos metadados de licença do repositório no GitHub
  • Roda inteiramente no dispositivo via runtime LiteRT-LM do Google, usando exclusivamente arquivos de modelo .litertlm — não suporta GGUF
  • Expõe uma API HTTP compatível com a OpenAI (chat completions, completions), além de endpoints compatíveis com a API de mensagens da Anthropic, para outros dispositivos da rede local chamarem
  • Mais de 350 estrelas e 47 forks no GitHub no momento desta análise; o lançamento mais recente marcado é v0.9.6-beta.1 (6 de junho de 2026), então o projeto ainda não chegou a uma versão 1.0

📍 Em uma frase

O OlliteRT é um aplicativo Android gratuito e de código aberto (Apache-2.0), criado pelo desenvolvedor NightMean, que transforma um celular em um servidor de inferência de LLM totalmente local e compatível com a OpenAI usando o runtime LiteRT-LM do Google, com mais de 350 estrelas no GitHub no momento desta análise.

💬 Em termos simples

Em vez de rodar um app de chat no seu celular, o OlliteRT transforma o próprio celular em um pequeno servidor: você carrega um modelo nele, inicia o servidor, e outros dispositivos da sua rede doméstica — um notebook, um script, uma ferramenta de automação residencial — podem enviar texto e receber uma resposta, da mesma forma que falariam com a API da OpenAI, exceto que tudo roda no celular.

📌Nota: Esta análise é baseada no próprio repositório do GitHub, no README e no histórico de lançamentos do OlliteRT. Ela não afirma que a PromptQuorum realizou benchmarks práticos de desempenho ou consumo de bateria em um modelo específico de celular.

O que é o OlliteRT?

O OlliteRT é um aplicativo Android que transforma o celular em que roda em um servidor de inferência de LLM local, descrito na própria descrição do repositório GitHub como uma forma de "transformar seu celular Android em um servidor de inferência de LLM compatível com a OpenAI — totalmente local, privado e de código aberto". Ele não tem janela de chat própria; seu propósito é executar inferência e responder solicitações HTTP de outros softwares.

  • Tipo de produto: um aplicativo de servidor backend para Android, não um cliente de chat — nenhuma interface de chat incluída
  • Criador: o desenvolvedor NightMean; o repositório do GitHub está hospedado em github.com/NightMean/OlliteRT
  • Repositório criado em 6 de abril de 2026, segundo os metadados do repositório no GitHub — um projeto jovem no momento desta análise
  • Licença: Apache-2.0, confirmada pelos metadados de licença do repositório no GitHub
  • Motor de inferência: o runtime no dispositivo LiteRT-LM do Google, a mesma tecnologia usada pelo próprio Google para seus recursos de IA no dispositivo em suas ferramentas Android
  • Escala: mais de 350 estrelas e 47 forks no GitHub no momento desta análise

Histórico do projeto e marcos de versão

O repositório do GitHub do OlliteRT foi criado em 6 de abril de 2026, e desde então lançou três versões marcadas anteriores à 1.0, todas ainda rotuladas como beta.

  1. 1
    6 de abril de 2026: repositório criado
    Why it matters: Marca o início do projeto, segundo os metadados do repositório no GitHub.
  2. 2
    v0.9.0-beta.1 — 24 de abril de 2026
    Why it matters: O primeiro lançamento marcado encontrado na página de releases do GitHub do projeto.
  3. 3
    v0.9.5-beta.1 — 30 de abril de 2026
    Why it matters: Um lançamento beta de acompanhamento cerca de uma semana após a primeira tag.
  4. 4
    v0.9.6-beta.1 — 6 de junho de 2026
    Why it matters: O lançamento marcado mais recente no momento desta análise; o projeto ainda não lançou uma versão 1.0.

O que o OlliteRT realmente faz?

O OlliteRT carrega um arquivo de modelo .litertlm no celular, executa a inferência através do runtime LiteRT-LM do Google usando a própria CPU e GPU do celular, e serve o resultado via uma API HTTP compatível com a OpenAI que outros dispositivos da mesma rede podem chamar.

  • Inferência no dispositivo: usa exclusivamente o runtime LiteRT-LM do Google — sem fallback para a nuvem, sem outro motor backend
  • Formato de modelo: apenas arquivos .litertlm; não suporta GGUF, o formato usado por ferramentas baseadas em llama.cpp
  • Obtenção de modelos: downloads com um toque diretamente do HuggingFace para modelos compatíveis, segundo o README do projeto
  • Compatibilidade de API: expõe endpoints de chat completions e completions compatíveis com a OpenAI, além de endpoints compatíveis com a API de mensagens da Anthropic, via HTTP na rede local
  • Suporte multimodal: modelos de visão, áudio e "raciocínio" (thinking) são suportados desde que o próprio modelo subjacente suporte esses modos, segundo o README
  • Aceleração de hardware: configurações de aceleração por GPU ou CPU ajustáveis para cada modelo
  • Ferramentas operacionais: uma ferramenta de benchmarking integrada, registro de atividades com destaque de JSON, um painel de monitoramento do servidor, integração com métricas do Prometheus e integração com a API REST do Home Assistant
  • Design de modelo único e sequencial: o README documenta que apenas um modelo é carregado por vez e as solicitações são processadas sequencialmente, não em paralelo

Exemplos de uso: duas formas de usar o OlliteRT

Estes são fluxos de trabalho concretos construídos a partir dos recursos documentados do projeto descritos acima.

Plataforma, preço e licenciamento

Plataforma

O que o OlliteRT declara:
Somente Android (dispositivos arm64-v8a, Android 12+). Sem versão para iOS, desktop ou web.

Custo

O que o OlliteRT declara:
Gratuito e de código aberto. Nenhuma conta, assinatura ou compra dentro do app encontrada no README.

Licenciamento

O que o OlliteRT declara:
Apache-2.0, confirmada pelos metadados de licença do repositório no GitHub.

Hardware mínimo

O que o OlliteRT declara:
Mínimo de 6 GB de RAM segundo o README; 8 GB+ recomendado, e mais para modelos maiores ou multimodais, como o Gemma 4 E4B (precisa de 12 GB de RAM).

Método de instalação

O que o OlliteRT declara:
Download direto de APK a partir da página de releases do GitHub; nenhuma listagem na Google Play ou F-Droid encontrada no momento desta análise.

Verifique as recomendações de hardware atuais e a lista de modelos suportados diretamente no GitHub antes de escolher um celular ou modelo, já que ambos podem mudar conforme o projeto (ainda anterior à 1.0) amadurece.

OlliteRT vs. PocketPal AI

O OlliteRT e o PocketPal AI rodam LLMs localmente em um celular, mas com propósitos diferentes: o OlliteRT é um servidor sem interface com o qual outros dispositivos conversam, enquanto o PocketPal AI é um app de chat que você usa diretamente no próprio celular.

Aspecto
OlliteRT
PocketPal AI
Uso principalServidor de inferência sem interface para outros dispositivos da redeApp de chat no dispositivo, usado diretamente no celular
Interface de chatNenhuma incluídaInterface de chat embutida
Motor de inferênciaGoogle LiteRT-LMBaseado em llama.cpp (modelos GGUF)
Formato de modeloSomente .litertlmGGUF
PlataformaSomente AndroidAndroid e iOS
Servidor de APIAPI HTTP compatível com a OpenAI, recurso principalNão é um recurso principal

Se você quer enviar solicitações de um notebook, script ou hub de automação residencial para um celular atuando como servidor, o OlliteRT foi feito para isso. Se você quer conversar com um modelo local diretamente na tela do próprio celular, um app focado em chat como o PocketPal AI se encaixa melhor — veja a análise do PocketPal AI para mais detalhes.

Quem deveria usar o OlliteRT?

O OlliteRT é indicado para desenvolvedores e entusiastas que querem reaproveitar um celular Android como um servidor de LLM dedicado e totalmente local para outros dispositivos, em vez de conversar com um modelo no próprio celular.

Para que o OlliteRT não é indicado

O OlliteRT não é uma boa opção se você precisa de uma interface de chat, suporte a modelos GGUF, processamento de solicitações em paralelo, ou um histórico de lançamentos longo e estável.

  • Não é um app de chat — não tem janela de chat própria; ele só responde solicitações de API HTTP de outros softwares
  • Não é compatível com GGUF — funciona exclusivamente com arquivos de modelo .litertlm, então não consegue carregar os modelos GGUF usados pelo llama.cpp, Ollama ou a maioria das outras ferramentas de LLM local sem uma etapa de conversão separada
  • Não é feito para carga concorrente — o README documenta um único modelo carregado e processado sequencialmente, então não é projetado como um servidor multiusuário ou de alta demanda
  • Não é compatível com iOS — exclusivo para Android, e especificamente dispositivos arm64-v8a
  • Não é um lançamento 1.0 maduro — o repositório tem cerca de cinco meses no momento desta análise, e sua versão marcada mais recente (v0.9.6-beta.1) ainda carrega o rótulo beta

Erros comuns ao avaliar o OlliteRT

A maior parte da confusão sobre o OlliteRT vem de presumir que é um app de chat, confundir seu formato de modelo com GGUF, ou não perceber que é um projeto jovem.

Concorrentes e alternativas

O OlliteRT é mais frequentemente comparado a outros apps de LLM local para Android/celular — seu principal diferencial é ser um servidor sem interface e compatível com a OpenAI, em vez de um cliente de chat no celular.

Ferramenta
Conhecida por
Link
PocketPal AIApp de chat no dispositivo para Android e iOS, modelos GGUF via llama.cppAnálise do PocketPal AI
LaylaApp de chat para Android focado em roleplay local sem censura e uso como assistenteAnálise do Layla
Google AI Edge GalleryApp de demonstração do próprio Google para modelos no dispositivo via LiteRT/MediaPipeAnálise do Google AI Edge Gallery
MLC ChatApp de chat local multiplataforma (Android/iOS) construído sobre o stack compilador MLC LLMAnálise do MLC Chat

Esta lista reflete ferramentas comumente comparadas ao OlliteRT no espaço de LLM móvel/no dispositivo, não um ranking independente da PromptQuorum — verifique o conjunto de recursos e os formatos de modelo suportados por cada ferramenta antes de escolher.

Perguntas frequentes

O que é o OlliteRT?

O OlliteRT (github.com/NightMean/OlliteRT) é um aplicativo Android gratuito e de código aberto (Apache-2.0), criado pelo desenvolvedor NightMean, que transforma um celular em um servidor de inferência de LLM totalmente local e compatível com a OpenAI usando o runtime LiteRT-LM do Google.

O OlliteRT tem interface de chat?

Não. O OlliteRT não tem janela de chat própria. É um servidor sem interface — você interage com ele via sua API HTTP a partir de outro dispositivo ou aplicativo, não digitando diretamente no app.

O OlliteRT é gratuito?

Sim, o OlliteRT é gratuito e de código aberto sob a licença Apache-2.0. Esta análise não encontrou exigência de conta, assinatura ou compra dentro do app.

Qual formato de modelo o OlliteRT usa?

O OlliteRT usa exclusivamente arquivos de modelo .litertlm, para o runtime no dispositivo LiteRT-LM do Google. Ele não suporta GGUF, o formato usado por ferramentas baseadas em llama.cpp.

Quais são os requisitos de hardware do OlliteRT?

Android 12 ou posterior em um dispositivo arm64-v8a, com no mínimo 6 GB de RAM (8 GB+ recomendado). Modelos maiores ou multimodais, como o Gemma 4 E4B, precisam de 12 GB de RAM ou mais, segundo o README do projeto.

O OlliteRT funciona sem conexão com a internet?

A inferência em si roda inteiramente no dispositivo depois que um modelo é baixado, então nenhuma conexão com a internet é necessária para isso. Uma conexão de rede local é necessária para que outros dispositivos alcancem o servidor de API do celular, e o acesso à internet é necessário para baixar inicialmente os modelos do HuggingFace.

O OlliteRT consegue lidar com várias solicitações ao mesmo tempo?

Não. O README do projeto documenta que apenas um modelo é carregado por vez e as solicitações são processadas sequencialmente, não em paralelo — não é projetado para carga concorrente e multiusuário.

O OlliteRT está disponível para iOS?

Não, o OlliteRT é exclusivo para Android, e especificamente exige um dispositivo arm64-v8a rodando Android 12 ou posterior.

Como instalo o OlliteRT?

Baixe o APK diretamente na página de releases do GitHub. No momento desta análise, ele não está listado na Google Play nem na F-Droid.

O OlliteRT é um projeto maduro e estável?

Ainda não. Seu repositório do GitHub foi criado em abril de 2026, e seu lançamento marcado mais recente (v0.9.6-beta.1, junho de 2026) ainda carrega o rótulo beta — trate-o como um projeto em desenvolvimento ativo, anterior à versão 1.0.

Fontes

← Voltar para LLMs locais avançados