Principais conclusões
- O Plano (github.com/katanemo/plano) é um proxy e data plane de IA gratuito, de código aberto e auto-hospedado — não um produto SaaS hospedado
- Desenvolvido pela Katanemo, e construído sobre o Envoy pelos próprios contribuidores principais do Envoy
- Licenciado sob Apache 2.0, confirmado pelo arquivo de licença do repositório no GitHub
- Quatro capacidades principais segundo seu próprio README: orquestração de agentes, roteamento de modelos ("Model Agility"), observabilidade sem código ("Agentic Signals" mais OpenTelemetry) e Filter Chains de guardrail/moderação
- O roteamento passa por um modelo orquestrador dedicado de cerca de 4 bilhões de parâmetros ("Plano-Orchestrator"), em vez de um LLM de propósito geral ou um framework baseado apenas em regras
- Mais de 7.050 estrelas no GitHub e 480+ forks no momento desta análise
📍 Em uma frase
O Plano é um servidor proxy e data plane nativo de IA, gratuito e de código aberto (Apache 2.0), baseado em Envoy, desenvolvido pela Katanemo, com mais de 7.050 estrelas no GitHub, que adiciona roteamento de LLM, orquestração de agentes, observabilidade e guardrails a aplicações agênticas fora do código da aplicação.
💬 Em termos simples
O Plano é um proxy auto-hospedado que você roda na frente dos seus agentes de IA. Em vez de escrever sua própria lógica de roteamento, telemetria e filtros de segurança em cada agente, você declara seus agentes e provedores de modelo em um arquivo de configuração YAML, e o Plano cuida de escolher o modelo certo, rastrear o que aconteceu e aplicar guardrails — de graça, já que o próprio Plano não cobra licença.
📌Nota: Esta análise é o complemento detalhado da entrada do Plano no Diretório de Software LLM Local — veja essa página para saber como o Plano se compara rapidamente a dezenas de outras ferramentas de IA locais e auto-hospedadas.
O que é o Plano?
O Plano é um proxy e data plane auto-hospedado, fora do processo, que fica entre suas aplicações agênticas e os provedores de LLM ou subagentes que elas chamam, lidando com roteamento, orquestração, observabilidade e guardrails em uma única camada. Sua própria descrição no GitHub o chama de "um servidor proxy e data plane nativo de IA para apps agênticas", com o objetivo de tirar questões de infraestrutura, como roteamento e moderação, do código da aplicação e colocá-las em uma camada compartilhada e configurável.
- Tipo de produto: um proxy/data plane auto-hospedado que você mesmo implanta (contêiner Docker ou binário compilado), não uma API ou gateway SaaS hospedada
- Desenvolvedor: Katanemo, segundo a organização do GitHub que hospeda o repositório
- Repositório: github.com/katanemo/plano, criado em 9 de julho de 2024
- Licença: Apache 2.0, segundo o arquivo de licença do repositório no GitHub
- Base: construído sobre o Envoy, o proxy de borda/serviço open source amplamente usado, por contribuidores que trabalharam no próprio Envoy, segundo o README do Plano
- Escala: mais de 7.050 estrelas no GitHub, 480+ forks e 140 issues abertas no momento desta análise
Histórico do projeto Plano e marcos de versões
O repositório do Plano no GitHub foi criado em julho de 2024, e o projeto tem lançado versões continuamente desde então, adicionando recursos de roteamento de LLM, orquestração de agentes e observabilidade em desenvolvimento ativo. O Plano se posiciona como apoiado pela própria pesquisa de LLM da Katanemo, incluindo o modelo orquestrador dedicado usado para suas decisões de roteamento.
- 1Repositório criado — 9 de julho de 2024
Why it matters: O repositório canônico do Plano no GitHub (katanemo/plano) foi criado, segundo os metadados do repositório do GitHub. - 2v0.4.36 — 19 de agosto de 2026: versão com tag mais recente no momento desta análise
Why it matters: A versão mais recente publicada no GitHub no momento desta análise; consulte diretamente a [página de releases](https://github.com/katanemo/plano/releases) para qualquer coisa lançada após a data de publicação desta análise. - 3Desenvolvimento contínuo na branch principal
Why it matters: Os metadados do repositório no GitHub mostram commits enviados à branch principal após a última versão com tag, indicando desenvolvimento contínuo além da última tag de versão — verifique o status atual de releases antes de assumir paridade de recursos com os commits mais recentes.
O que o Plano realmente faz?
O conjunto de recursos do Plano se concentra em tirar as questões de infraestrutura das apps agênticas do código da aplicação e colocá-las em uma camada de proxy compartilhada e auto-hospedada. Veja o que cada parte realmente faz, segundo o próprio README no GitHub e a documentação do Plano.
- Orquestração de agentes — roteamento de baixa latência entre agentes declarados em uma configuração YAML, sem modificar o código da aplicação; novos agentes podem ser adicionados editando a configuração em vez de reescrever a lógica de roteamento
- Roteamento de modelos ("Model Agility") — roteia requisições por nome de modelo explícito, alias semântico, ou automaticamente via preferências configuradas, para que o código da aplicação possa chamar um nome de modelo lógico em vez de fixar um provedor específico no código
- Agentic Signals — termo próprio do Plano para a captura sem código de sinais de uso/comportamento, além de traces e métricas compatíveis com OpenTelemetry emitidos em cada agente que ele faz proxy
- Filter Chains de guardrail e moderação — um mecanismo configurável para incorporar proteção contra jailbreak, políticas de moderação e comportamento de consistência de memória na camada de proxy em vez de em cada agente individual
- Modelo de roteamento dedicado — as decisões de roteamento passam pelo próprio modelo "Plano-Orchestrator" do Plano, de cerca de 4 bilhões de parâmetros, em vez de uma chamada a um LLM de propósito geral ou um roteador puramente baseado em regras, segundo o README do Plano
- Agnóstico a framework e linguagem — os agentes são simplesmente servidores HTTP que implementam um endpoint de chat completions compatível com OpenAI, então o Plano funciona com agentes escritos em qualquer linguagem ou framework de IA
- Modo gateway de LLM — o Plano também pode ser usado puramente como gateway de roteamento de LLM a partir de serviços de aplicação, independentemente de seus recursos de orquestração de agentes, segundo sua própria documentação
Exemplos de uso: duas formas de usar o Plano
Estes são fluxos de trabalho concretos construídos a partir do próprio exemplo documentado no README do Plano — não casos de uso hipotéticos.
Instalar o Plano
O Plano se instala gratuitamente via Docker ou um binário CLI compilado, e seu código-fonte está no GitHub. Segundo seu próprio guia de início rápido, instale os pré-requisitos e depois inicie o Plano com planoai up config.yaml apontando para um arquivo de configuração.
Source | Link |
|---|---|
| Repositório no GitHub (código-fonte, Apache 2.0) | github.com/katanemo/plano |
| Guia de início rápido (instalação + pré-requisitos) | docs.planoai.dev/get_started/quickstart |
| Documentação completa | docs.planoai.dev |
| Releases (versões com tag e binários pré-compilados) | github.com/katanemo/plano/releases |
O Plano exige seguir o guia de pré-requisitos antes de executar planoai up config.yaml; não existe um instalador gráfico de arquivo único, já que o Plano é um componente de proxy/data plane feito para rodar ao lado dos seus serviços, em vez de ser uma aplicação independente para o usuário final. Verifique o método de instalação atualmente recomendado no guia de início rápido antes de executar qualquer comando, já que as instruções de instalação podem mudar entre versões.
Preço do Plano: ele é mesmo gratuito?
O Plano em si é gratuito e de código aberto (Apache 2.0), sem taxa de licença para auto-hospedá-lo. A nuance está no que alimenta seu roteamento: o Plano e a família de LLMs do Plano (como o Plano-Orchestrator) são hospedados gratuitamente na região US-central pela Katanemo, explicitamente para dar aos desenvolvedores uma primeira experiência sem configuração — segundo o próprio README do projeto, esse nível hospedado gratuito é voltado para desenvolvimento, não para escala de produção.
- O software do Plano em si: gratuito, de código aberto, licenciado sob Apache 2.0, sem nível pago para o proxy em si
- Modelos de roteamento/orquestração da família Plano: hospedados gratuitamente em US-central para uma primeira experiência de desenvolvedor, segundo o próprio README do Plano
- Para rodar em escala de produção, o README da Katanemo afirma que você deve rodar esses modelos de roteamento localmente por conta própria, ou contatar a Katanemo pelo Discord para obter chaves de API hospedadas — nenhuma página pública de preços self-service para essa opção de chaves hospedadas foi encontrada nesta análise
- Os custos do provedor de LLM são separados: rotear requisições para a OpenAI, Anthropic ou outros provedores via Plano ainda custa o que esse provedor cobra — o Plano em si não adiciona margem, conforme seu papel como camada de roteamento, e não como provedor de modelo
Plano vs. LiteLLM
O Plano e o LiteLLM são ambos camadas auto-hospedadas para gerenciar tráfego de LLM, mas partem de premissas diferentes: o LiteLLM é principalmente uma API/SDK unificada e um proxy para chamar mais de 100 provedores de LLM através de uma interface compatível com OpenAI, enquanto o Plano é construído como um data plane baseado em Envoy com orquestração de agentes como recurso de primeira classe, não apenas roteamento de modelos.
Base principal
- Plano vs. LiteLLM:
- O Plano é construído sobre o proxy Envoy; o LiteLLM é um SDK e servidor proxy nativo em Python, não baseado em Envoy.
Orquestração de agentes
- Plano vs. LiteLLM:
- O Plano trata o roteamento multiagente como um recurso central de primeira classe via agentes declarados em YAML; o LiteLLM foca principalmente em roteamento de LLM/provedor, em vez de orquestração agente a agente.
Mecanismo de roteamento
- Plano vs. LiteLLM:
- O Plano usa um modelo orquestrador dedicado de cerca de 4 bilhões de parâmetros para roteamento baseado em intenção; o LiteLLM roteia principalmente via regras de configuração explícitas, balanceamento de carga e listas de fallback.
Observabilidade
- Plano vs. LiteLLM:
- O Plano chama sua telemetria de "Agentic Signals" mais OpenTelemetry; o LiteLLM oferece rastreamento de uso, logs de gastos e integrações com ferramentas de observabilidade como o Langfuse.
Licença
- Plano vs. LiteLLM:
- Ambos têm licença Apache 2.0 para sua oferta principal de código aberto, segundo o próprio repositório de cada projeto.
As duas ferramentas são auto-hospedadas e gratuitas em seu núcleo; a escolha prática depende de você precisar de infraestrutura de proxy de nível Envoy e orquestração nativa de agentes (Plano) ou de um gateway mais simples focado em roteamento de provedores, com uma lista ampla de compatibilidade (LiteLLM). Verifique a paridade atual de recursos na documentação de cada projeto antes de escolher, já que ambos lançam atualizações com frequência.
Quem deveria usar o Plano?
O Plano ser ou não indicado depende de você estar construindo aplicações agênticas que precisam de infraestrutura compartilhada para roteamento, observabilidade e guardrails, em vez de uma única chamada simples a um LLM.
Concorrentes e alternativas
O Plano é mais frequentemente comparado ao LiteLLM, AIClient2API e Langfuse — seu principal diferencial é ser um data plane baseado em Envoy com orquestração nativa multiagente, em vez de uma biblioteca de roteamento puramente em nível de aplicação ou uma ferramenta só de observabilidade.
Tool | Best known for | Link |
|---|---|---|
| LiteLLM | Proxy/SDK unificado para chamar mais de 100 provedores de LLM através de uma API compatível com OpenAI | Análise do LiteLLM |
| AIClient2API | Proxy local leve que converte vários protocolos de clientes de IA em endpoints de API unificados | Análise do AIClient2API |
| Langfuse | Plataforma open source de observabilidade, rastreamento e avaliação de LLM | Análise do Langfuse |
Esta lista reflete ferramentas frequentemente comparadas ao Plano no espaço de roteamento/gateway/observabilidade, não um ranking independente da PromptQuorum — veja o Diretório de Software LLM Local para o catálogo completo e regularmente atualizado, incluindo a própria entrada do Plano. Verifique o preço e o conjunto de recursos atuais de cada ferramenta antes de escolher.
Erros comuns ao avaliar o Plano
A maior parte da confusão sobre o Plano vem do seu nome genérico, de assumir que é um SaaS hospedado, ou de expectativas pouco claras sobre o que "gratuito" cobre.
Perguntas frequentes
O que é o Plano?
O Plano (github.com/katanemo/plano) é um servidor proxy e data plane nativo de IA, gratuito e de código aberto (Apache 2.0), baseado em Envoy, para aplicações agênticas, desenvolvido pela Katanemo, que cuida de roteamento de LLM, orquestração de agentes, observabilidade e guardrails.
O Plano é gratuito?
Sim, o Plano em si é gratuito e de código aberto, sem taxa de licença para auto-hospedá-lo. A Katanemo também hospeda gratuitamente os próprios modelos de roteamento/orquestração do Plano na região US-central para uma primeira experiência de desenvolvedor; usar esses modelos em escala de produção exige auto-hospedá-los ou obter chaves de API hospedadas pelo Discord.
Como instalo o Plano?
Siga o próprio guia de início rápido do Plano para instalar os pré-requisitos, e então execute planoai up config.yaml apontando para uma configuração YAML que declare seus agentes e provedores de modelo.
O Plano é um serviço hospedado ou software auto-hospedado?
O Plano é auto-hospedado: você mesmo o implanta como um contêiner Docker ou binário compilado, junto com seus próprios agentes e serviços. A Katanemo hospeda separadamente os próprios modelos orquestradores pequenos do Plano gratuitamente no nível de uso de desenvolvimento.
O que o Plano realmente roteia?
O Plano roteia tráfego de LLM e de agentes: ele pode rotear entre múltiplos agentes com base na intenção, e rotear chamadas de API de LLM para um modelo específico por nome explícito, alias semântico, ou seleção automática baseada em preferências.
O Plano é construído sobre o Envoy?
Sim, segundo seu próprio README, o Plano é construído sobre o Envoy por contribuidores que trabalharam no próprio Envoy, funcionando como um data plane fora do processo, em vez de uma biblioteca em processo.
Quem desenvolve o Plano?
A Katanemo desenvolve o Plano, segundo a organização do GitHub que hospeda o repositório katanemo/plano.
O Plano funciona com qualquer linguagem de programação ou framework?
Sim — os agentes só precisam implementar um endpoint HTTP de chat completions compatível com OpenAI, então o Plano funciona com agentes escritos em qualquer linguagem ou framework de IA, segundo sua própria documentação.
O Plano exige seu próprio modelo para funcionar?
As decisões de roteamento do Plano passam pelo seu próprio modelo orquestrador dedicado, de cerca de 4 bilhões de parâmetros, mas as respostas de LLM que seus agentes realmente usam podem vir de qualquer provedor configurado (OpenAI, Anthropic, modelos locais e outros) para o qual o Plano roteia o tráfego.
Como o Plano é diferente do LiteLLM?
O Plano é um data plane baseado em Envoy com orquestração nativa multiagente como recurso central; o LiteLLM é um SDK/proxy nativo em Python focado principalmente em unificar chamadas a mais de 100 provedores de LLM. Veja a comparação Plano vs. LiteLLM acima para mais detalhes.
A PromptQuorum testou de forma independente as afirmações do Plano?
Esta análise se baseia no próprio repositório do GitHub, README e documentação do Plano, e não em testes práticos realizados pela PromptQuorum.