Principais conclusões
- Um kit de desenvolvimento de software (SDK), não um app independente para baixar — veja Instalação e primeiros passos abaixo para como os desenvolvedores de fato o integram a um projeto
- Cobre chat com LLM, reconhecimento de fala (STT), síntese de fala (TTS), detecção de atividade de voz (VAD), modelos de visão e linguagem (VLM), embeddings e geração aumentada por recuperação (RAG), segundo o próprio README do GitHub do projeto
- Roda sobre um núcleo de runtime nativo em C++ compartilhado, com engines específicas de hardware: MetalRT para Apple Silicon e QHexRT para as NPUs Hexagon da Qualcomm
- Gratuito sob a "RunAnywhere License" para pessoas físicas, educação, organizações sem fins lucrativos, órgãos governamentais, projetos de código aberto aprovados pela OSI, e organizações com menos de US$ 1 milhão em financiamento E menos de US$ 1 milhão em receita anual; organizações comerciais maiores precisam de uma licença paga da RunAnywhere, Inc. — veja Licença e preços abaixo para a nuance completa
- SDKs nativos para Swift (iOS 17.5+/macOS 14.5+), Kotlin (Android API 24+), Flutter, React Native, web (TypeScript/WASM), Python e uma CLI de terminal (
rcli) - O repositório no GitHub (github.com/RunanywhereAI/runanywhere-sdks) mostra cerca de 10.300 estrelas e 376 forks no momento desta review
- Desenvolvedor: RunAnywhere, Inc., que se descreve como um "laboratório de inferência voltado à pesquisa" que constrói kernels de GPU/NPU escritos à mão para silício de consumo
📍 Em uma frase
RunAnywhere é um SDK de IA no dispositivo que desenvolvedores incorporam a apps iOS, Android, Flutter, React Native e web para executar localmente recursos de LLM, voz e detecção de voz, gratuito para organizações pequenas e uso não comercial sob sua própria licença personalizada.
💬 Em termos simples
Em vez de um app de chat que você instala sozinho, o RunAnywhere é um conjunto de ferramentas que desenvolvedores de apps incorporam ao próprio software para que seu app possa executar recursos de IA — conversar com um modelo, transcrever fala ou ler texto em voz alta — diretamente no seu celular ou notebook, sem enviar nada para um servidor. Se você não está desenvolvendo um app, não vai interagir com o RunAnywhere diretamente; você o encontraria dentro de um app construído com ele.
📌Nota: Esta review é o complemento aprofundado da entrada do RunAnywhere no Diretório de Software de LLM Local — veja essa página para comparar rapidamente o RunAnywhere com dezenas de outras ferramentas de IA local.
O que é o RunAnywhere?
RunAnywhere é um kit de desenvolvimento de software para executar inferência de IA no próprio dispositivo em que um app já está rodando, em vez de chamar uma API na nuvem a cada solicitação. Segundo sua própria descrição no GitHub, o projeto se posiciona como "um SDK. Todo dispositivo. LLMs, visão, voz, agentes de voz, RAG, embeddings e geração de imagens, rodando localmente em celulares, navegadores, desktops e servidores." Ele é voltado especificamente a desenvolvedores que constroem seus próprios aplicativos iOS, Android, Flutter, React Native ou web — não a usuários procurando um app de chat para instalar diretamente.
- Função principal: um runtime em C++ compartilhado mais SDKs por plataforma (Swift, Kotlin, Flutter, React Native, TypeScript, Python) que expõem o mesmo padrão de API para executar modelos localmente
- Exemplo de chamada de API mostrado na própria documentação do RunAnywhere:
RunAnywhere.llm.generate("Name three colours")— a mesma estrutura de chamada deve funcionar independentemente de a plataforma subjacente ser Swift, Kotlin ou JavaScript - Desenvolvedor: RunAnywhere, Inc., uma empresa que se descreve como um "laboratório de inferência voltado à pesquisa" que escreve seus próprios kernels de GPU e NPU para hardware de consumo, em vez de depender apenas de bibliotecas de inferência genéricas
- Repositório canônico: github.com/RunanywhereAI/runanywhere-sdks — o monorepo que hospeda o runtime compartilhado e todos os pacotes de SDK por plataforma
- Documentação: docs.runanywhere.ai, com guias de início rápido por plataforma para Swift, Kotlin, React Native, Flutter, web e Electron
Instalação e primeiros passos
RunAnywhere fica isento de uma etapa de "download" no sentido usual — não há instalador nem página em loja de apps para o SDK em si, já que se trata de código que um desenvolvedor adiciona ao próprio projeto. Os comandos abaixo vêm do próprio README do GitHub do RunAnywhere e da página no pub.dev — sempre confira essas páginas diretamente para o número de versão atual, já que o RunAnywhere lança versões com frequência.
- 1iOS / macOS (Swift)
Why it matters: Adicione o pacote via Swift Package Manager, apontando para `https://github.com/RunanywhereAI/runanywhere-sdks`. Requer iOS 17.5+ ou macOS 14.5+. - 2Android (Kotlin)
Why it matters: Adicione a dependência do Gradle: `implementation("io.github.sanchitmonga22:runanywhere-sdk:0.20.11")` (mais um módulo de engine como `runanywhere-llamacpp` para o backend de inferência baseado em llama.cpp). Requer Android API 24+. - 3Flutter
Why it matters: Adicione ao `pubspec.yaml`: `runanywhere: ^0.20.11` (mais `runanywhere_llamacpp: ^0.20.11` para a engine de inferência local). Página do pacote: [pub.dev/packages/runanywhere](https://pub.dev/packages/runanywhere). - 4Web (TypeScript/WASM)
Why it matters: Instale via npm: `npm install @runanywhere/web@0.20.11 @runanywhere/web-llamacpp@0.20.11`. Roda no navegador usando WebAssembly, com aceleração WebGPU onde o navegador suportar. - 5Python
Why it matters: Instale via pip: `pip install runanywhere`. Voltado a uso desktop/servidor em Windows, macOS e Linux. - 6Terminal (rcli)
Why it matters: macOS/Linux: `brew install runanywhereai/tap/rcli`, ou o script de instalação `curl -fsSL https://raw.githubusercontent.com/RunanywhereAI/RCLI/main/install.sh | sh`. Windows: `irm https://raw.githubusercontent.com/RunanywhereAI/RCLI/main/install.ps1 | iex`.
Licença e preços: a nuance que a maioria das reviews ignora
RunAnywhere não é simplesmente "código aberto" — ele é publicado sob uma licença personalizada que o próprio repositório descreve como "baseada na Apache 2.0, com termos comerciais adicionais", não a licença Apache 2.0 sem modificações. Segundo uma leitura direta do arquivo LICENSE no repositório do SDK, o uso gratuito exige atender a condições específicas, e uma organização com fins lucrativos acima de determinados limites precisa de uma licença comercial separada.
Pessoa física (uso pessoal, educacional, não comercial)
- Termos da licença:
- Gratuito sob a RunAnywhere License
Instituição de ensino, organização sem fins lucrativos, órgão governamental ou projeto de código aberto aprovado pela OSI
- Termos da licença:
- Gratuito sob a RunAnywhere License
Organização com menos de US$ 1 milhão em financiamento E menos de US$ 1 milhão em receita anual
- Termos da licença:
- Gratuito sob a RunAnywhere License
Organização acima de qualquer um dos dois limites
- Termos da licença:
- Exige uma licença comercial paga da RunAnywhere, Inc. (contato segundo o arquivo LICENSE: san@runanywhere.ai)
Uma organização que se qualifica recebe a cláusula de reserva da Parte III da licença, que concede termos no estilo da Apache License 2.0 (direitos perpétuos, mundiais e não exclusivos de uso, modificação e distribuição) — mas apenas enquanto continuar se qualificando. Segundo o texto da licença, se uma organização se qualifica inicialmente e depois ultrapassa qualquer um dos dois limites (US$ 1 milhão em financiamento ou US$ 1 milhão em receita), "a licença gratuita é automaticamente encerrada ao ultrapassar o limite", e uma licença comercial "deve ser obtida em até trinta (30) dias". Isso é bem diferente de uma licença de código aberto permissiva padrão, sem condições ligadas à receita — leia você mesmo o arquivo LICENSE atual antes de basear uma decisão jurídica ou de compra em qualquer resumo, incluindo este, já que os termos da licença podem mudar entre versões. Outra nuance que vale destacar explicitamente: esta review não conseguiu confirmar de forma independente que cada pacote específico de plataforma (por exemplo, o pacote Flutter no pub.dev) tenha uma concessão Apache 2.0 simples e delimitada separadamente, distinta da RunAnywhere License central — o campo de licença do pub.dev para o pacote Flutter aparece como não especificado e aponta de volta para o mesmo arquivo LICENSE do repositório, em vez de declarar uma licença separada. Verifique o arquivo LICENSE incluído no pacote específico que você planeja usar, em vez de supor que um SDK por plataforma é incondicionalmente Apache 2.0.
O que dá para construir com o RunAnywhere?
O conjunto de recursos do RunAnywhere abrange várias categorias de IA no dispositivo, todas expostas através do mesmo padrão de API nas linguagens suportadas, segundo o README do GitHub e a documentação do projeto.
- Chat com LLM e geração de texto — executar modelos de linguagem abertos no dispositivo para chat, resumo ou geração estruturada, sem chamada de rede por solicitação
- Reconhecimento de fala (STT) — transcrever áudio falado para texto localmente
- Síntese de fala (TTS) — gerar áudio falado a partir de texto localmente
- Detecção de atividade de voz (VAD) — detectar quando um usuário está falando, um componente básico para recursos de agente de voz e "push-to-talk"
- Modelos de visão e linguagem (VLM) — executar modelos capazes de processar tanto imagens quanto texto, incluindo o suporte a OCR documentado pelo próprio RunAnywhere
- Embeddings — gerar embeddings vetoriais no dispositivo, útil para busca no dispositivo ou geração aumentada por recuperação (RAG) sem enviar documentos a um servidor
- Roteamento de modelos — o próprio material do RunAnywhere descreve uma camada de roteamento para escolher entre diferentes modelos ou engines locais conforme a tarefa
Aceleração de hardware: MetalRT, QHexRT e WebGPU
O próprio posicionamento do RunAnywhere é que a empresa "escreve à mão os kernels de GPU e NPU que tornam o silício de consumo rápido", em vez de depender apenas de bibliotecas de inferência genéricas. Segundo o blog e a documentação do próprio projeto, isso se traduz em duas engines de inferência proprietárias com nome próprio, além de aceleração no lado do navegador.
MetalRT
- Hardware-alvo:
- Apple Silicon (Metal/MLX)
- O que é acelerado:
- Pipelines de LLM, modelos de visão e linguagem e speech-to-speech em dispositivos Mac e iOS
QHexRT
- Hardware-alvo:
- NPU Hexagon da Qualcomm Snapdragon (v75/v79/v81)
- O que é acelerado:
- LLM, VLM, reconhecimento de fala, síntese de fala e embeddings em dispositivos Android suportados
WebGPU
- Hardware-alvo:
- Navegadores com suporte a WebGPU
- O que é acelerado:
- Inferência no navegador para o SDK web/TypeScript, com fallback para execução somente com WebAssembly onde o WebGPU não estiver disponível
Segundo o próprio blog do RunAnywhere, a empresa relatou, em uma publicação de março de 2026, um throughput de decodificação de modelos de visão e linguagem no MetalRT que supera a biblioteca mlx-vlm em um M4 Max, e relatou, em uma publicação de julho de 2026, a implantação de um modelo de 27 bilhões de parâmetros (um modelo "PrismML Bonsai" quantizado em 1 bit, segundo a própria descrição do RunAnywhere) em iPhone, Android e Mac. Essas são alegações de desempenho e capacidade feitas pelo próprio RunAnywhere sobre seu produto, em seu próprio blog; a PromptQuorum não reproduziu esses benchmarks de forma independente e os apresenta aqui como números relatados pela empresa, não como resultados verificados por terceiros.
Plataformas e linguagens suportadas
RunAnywhere oferece oito pacotes de SDK separados que compartilham um núcleo de runtime nativo, segundo seu próprio README do GitHub.
iOS 17.5+ / macOS 14.5+
- Linguagem / gerenciador de pacotes:
- Swift, via Swift Package Manager
Android API 24+
- Linguagem / gerenciador de pacotes:
- Kotlin, via Gradle
iOS / Android (multiplataforma)
- Linguagem / gerenciador de pacotes:
- Flutter, via pub.dev
iOS / Android (multiplataforma)
- Linguagem / gerenciador de pacotes:
- React Native
Desktop Windows x64 (preview)
- Linguagem / gerenciador de pacotes:
- Electron
Windows / macOS / Linux
- Linguagem / gerenciador de pacotes:
- Python, via pip
Terminal (macOS / Linux / Windows)
- Linguagem / gerenciador de pacotes:
- CLI rcli, via Homebrew ou um script de instalação
O próprio projeto marca explicitamente o SDK de desktop para Windows (Electron) como um preview — trate-o como menos maduro que os SDKs de Swift, Kotlin ou Flutter ao decidir sobre o que construir recursos de produção. Sempre confira docs.runanywhere.ai para o nível de maturidade atual de um SDK de plataforma específico antes de se comprometer com ele.
Marcos recentes
RunAnywhere publica atualizações de engenharia no próprio blog com datas específicas. Os itens abaixo vêm desse blog; a PromptQuorum não verificou de forma independente os números de desempenho subjacentes — trate os números como relatados pela empresa.
- 1Agente de voz offline para Android (segundo o blog do RunAnywhere, fevereiro de 2026)
Why it matters: RunAnywhere descreve o lançamento de um agente de IA totalmente funcional no Android, sem dependência de nuvem. - 2Marco de latência do FastVoice (segundo o blog do RunAnywhere, fevereiro de 2026)
Why it matters: RunAnywhere relata latência de 63 ms até o primeiro áudio para um pipeline de voz no dispositivo. - 3Engine de fala para Apple Silicon (segundo o blog do RunAnywhere, março de 2026)
Why it matters: RunAnywhere descreve isso como sua primeira engine de inferência a tratar LLM, STT e TTS juntos no Apple Silicon. - 4Suporte a modelos de visão e linguagem no MetalRT (segundo o blog do RunAnywhere, março de 2026)
Why it matters: RunAnywhere relata um throughput de decodificação de modelos de visão no Apple Silicon que, segundo a empresa, supera a biblioteca mlx-vlm em um M4 Max. - 5Suporte a speech-to-speech no MetalRT (segundo o blog do RunAnywhere, março de 2026)
Why it matters: RunAnywhere relata latência de ponta a ponta de 1,68 segundo para um pipeline nativo de speech-to-speech. - 6Lançamento do QHexRT para NPUs Hexagon da Qualcomm (segundo o blog do RunAnywhere, junho de 2026)
Why it matters: RunAnywhere descreve isso como uma engine de inferência NPU full-stack cobrindo LLM, VLM, STT, TTS e embeddings em dispositivos Snapdragon suportados. - 7Modelo de 27 bilhões de parâmetros em hardware de celular (segundo o blog do RunAnywhere, julho de 2026)
Why it matters: RunAnywhere relata a implantação de um modelo de 27B quantizado em 1 bit em iPhone, Android e Mac, descrito como o primeiro modelo de 1 bit que a empresa executou em uma NPU.
Para quem o RunAnywhere é indicado?
RunAnywhere se encaixa em um tipo específico de decisão: uma equipe de desenvolvimento que constrói seu próprio aplicativo mobile ou web e quer recursos de IA no dispositivo em vez de depender de uma API na nuvem.
Concorrentes e alternativas
RunAnywhere se posiciona no segmento de SDKs/runtimes de inferência no dispositivo, ao lado de outras ferramentas que permitem aos desenvolvedores executar modelos localmente em vez de por meio de uma API na nuvem. Veja o Diretório de Software de LLM Local para o catálogo completo.
- MLC LLM — um framework de código aberto de compilação de ML para implantar LLMs em celulares, navegadores e outros dispositivos de borda; uma comparação mais próxima para equipes que querem compilar e controlar elas mesmas o grafo de inferência em vez de usar um SDK gerenciado.
- MLC Chat — o app de chat mobile de referência construído sobre o MLC LLM; útil como exemplo prático de como um SDK no dispositivo se parece do lado do usuário final, ainda que seja um app baixável em vez de um SDK para desenvolvedores.
- llama.cpp — a engine de inferência em C/C++ amplamente usada sobre a qual muitas ferramentas de IA local se apoiam, incluindo os próprios módulos de engine Android/Kotlin e Flutter/web do RunAnywhere, para inferência em CPU e multiplataforma.
- Docker Model Runner — um ponto de integração diferente para inferência local (um recurso de CLI do Docker Desktop/Engine em vez de um SDK de app mobile), útil como contraste para equipes decidindo entre uma abordagem de backend/servidor para inferência local e um SDK no dispositivo embutido diretamente em um app cliente.
Erros comuns ao avaliar o RunAnywhere
A maior parte da confusão sobre o RunAnywhere vem de seus termos de licença, de sua natureza de SDK e não de app, ou de generalizar demais as alegações de benchmark relatadas pela empresa.
Perguntas frequentes
O que é o RunAnywhere?
RunAnywhere (runanywhere.ai, código-fonte em github.com/RunanywhereAI/runanywhere-sdks) é um SDK de IA no dispositivo que desenvolvedores integram a aplicativos iOS, Android, Flutter, React Native e web para executar localmente chat com LLM, reconhecimento de fala, síntese de fala, detecção de atividade de voz e modelos de visão e linguagem no dispositivo do usuário.
O RunAnywhere é gratuito?
É gratuito sob a própria "RunAnywhere License" do projeto para pessoas físicas, educação, organizações sem fins lucrativos, órgãos governamentais, projetos de código aberto aprovados pela OSI, e organizações com menos de 1 milhão de dólares em financiamento E menos de 1 milhão de dólares em receita anual. Organizações acima de qualquer um dos dois limites precisam de uma licença comercial paga da RunAnywhere, Inc.
O RunAnywhere é de código aberto?
Parcialmente, com condições. O próprio repositório descreve a licença como "baseada na Apache 2.0, com termos comerciais adicionais", não a licença Apache 2.0 sem modificações. Usuários que se qualificam recebem permissões no estilo Apache 2.0, mas o nível gratuito depende de permanecer abaixo de limites específicos de financiamento e receita — leia diretamente o arquivo LICENSE antes de se basear nisso para uma decisão jurídica.
O RunAnywhere é um app baixável?
Não. RunAnywhere é um kit de desenvolvimento de software (SDK) que desenvolvedores integram aos próprios aplicativos — não é algo que um usuário final baixa e abre diretamente. Você só o encontraria dentro de um app que uma equipe de desenvolvimento construiu com ele.
Quais plataformas o RunAnywhere suporta?
Swift para iOS 17.5+ e macOS 14.5+, Kotlin para Android API 24+, Flutter, React Native, um SDK de TypeScript/WebAssembly para navegadores web, um pacote Python, um preview de desktop para Windows baseado em Electron, e uma CLI de terminal chamada rcli.
Como instalo o SDK do RunAnywhere para Flutter?
Adicione runanywhere: ^0.20.11 (e um pacote de engine como runanywhere_llamacpp) ao seu pubspec.yaml. Veja pub.dev/packages/runanywhere para a versão atual.
Quais recursos de IA o RunAnywhere suporta?
Chat com LLM e geração de texto, reconhecimento de fala, síntese de fala, detecção de atividade de voz, modelos de visão e linguagem (incluindo OCR), embeddings, geração aumentada por recuperação e roteamento de modelos, segundo a própria documentação do projeto.
O RunAnywhere usa aceleração por NPU ou GPU?
Sim. RunAnywhere relata duas engines de inferência proprietárias: MetalRT para Apple Silicon (Metal/MLX) e QHexRT para NPUs Hexagon da Qualcomm Snapdragon (v75/v79/v81), além de aceleração WebGPU em navegadores suportados.
Quantas estrelas no GitHub o RunAnywhere tem?
Cerca de 10.300 estrelas e 376 forks em github.com/RunanywhereAI/runanywhere-sdks no momento desta review — confira o repositório diretamente para o número atual.
Em que o RunAnywhere se diferencia do MLC LLM?
MLC LLM é um framework de código aberto de compilação de ML com o qual você mesmo compila os modelos; RunAnywhere é um SDK gerenciado com engines nativas pré-construídas (MetalRT, QHexRT) e um padrão de API consistente em várias linguagens cliente. Veja Concorrentes e alternativas acima para uma comparação mais completa.
