Skip to main content
PromptQuorum
Início/LLMs locais avançados/Plano: o proxy de IA baseado em Envoy para apps agênticas
Overview & Reference

Plano: o proxy de IA baseado em Envoy para apps agênticas

·11 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O Plano é um servidor proxy e data plane nativo de IA, gratuito e de código aberto, baseado em Envoy, para aplicações agênticas, construído pela Katanemo, que cuida do roteamento de LLM, orquestração de agentes, observabilidade e guardrails fora do código da sua aplicação. Ele tem licença Apache 2.0, roda como um proxy auto-hospedado fora do processo (não é um SaaS hospedado) e funciona no modelo bring-your-own-model — você o configura para usar OpenAI, Anthropic ou outros provedores, ou aponta para modelos locais, enquanto o próprio modelo orquestrador pequeno do Plano cuida das decisões de roteamento.

Plano (github.com/katanemo/plano) é um servidor proxy e data plane nativo de IA, gratuito, de código aberto e licenciado sob Apache 2.0, construído sobre o Envoy pelos próprios contribuidores principais do Envoy, e desenvolvido pela Katanemo. Ele centraliza o "middleware oculto" que as aplicações agênticas normalmente reimplementam em cada base de código — roteamento e orquestração de agentes, roteamento de modelos LLM, sinais e traces de observabilidade, e filtros de guardrail para segurança e moderação —, com mais de 7.050 estrelas no GitHub. Esta análise cobre o que o Plano realmente faz, como instalá-lo e executá-lo, quanto custa e para quem ele é indicado.

Principais conclusões

  • O Plano (github.com/katanemo/plano) é um proxy e data plane de IA gratuito, de código aberto e auto-hospedado — não um produto SaaS hospedado
  • Desenvolvido pela Katanemo, e construído sobre o Envoy pelos próprios contribuidores principais do Envoy
  • Licenciado sob Apache 2.0, confirmado pelo arquivo de licença do repositório no GitHub
  • Quatro capacidades principais segundo seu próprio README: orquestração de agentes, roteamento de modelos ("Model Agility"), observabilidade sem código ("Agentic Signals" mais OpenTelemetry) e Filter Chains de guardrail/moderação
  • O roteamento passa por um modelo orquestrador dedicado de cerca de 4 bilhões de parâmetros ("Plano-Orchestrator"), em vez de um LLM de propósito geral ou um framework baseado apenas em regras
  • Mais de 7.050 estrelas no GitHub e 480+ forks no momento desta análise

📍 Em uma frase

O Plano é um servidor proxy e data plane nativo de IA, gratuito e de código aberto (Apache 2.0), baseado em Envoy, desenvolvido pela Katanemo, com mais de 7.050 estrelas no GitHub, que adiciona roteamento de LLM, orquestração de agentes, observabilidade e guardrails a aplicações agênticas fora do código da aplicação.

💬 Em termos simples

O Plano é um proxy auto-hospedado que você roda na frente dos seus agentes de IA. Em vez de escrever sua própria lógica de roteamento, telemetria e filtros de segurança em cada agente, você declara seus agentes e provedores de modelo em um arquivo de configuração YAML, e o Plano cuida de escolher o modelo certo, rastrear o que aconteceu e aplicar guardrails — de graça, já que o próprio Plano não cobra licença.

📌Nota: Esta análise é o complemento detalhado da entrada do Plano no Diretório de Software LLM Local — veja essa página para saber como o Plano se compara rapidamente a dezenas de outras ferramentas de IA locais e auto-hospedadas.

O que é o Plano?

O Plano é um proxy e data plane auto-hospedado, fora do processo, que fica entre suas aplicações agênticas e os provedores de LLM ou subagentes que elas chamam, lidando com roteamento, orquestração, observabilidade e guardrails em uma única camada. Sua própria descrição no GitHub o chama de "um servidor proxy e data plane nativo de IA para apps agênticas", com o objetivo de tirar questões de infraestrutura, como roteamento e moderação, do código da aplicação e colocá-las em uma camada compartilhada e configurável.

  • Tipo de produto: um proxy/data plane auto-hospedado que você mesmo implanta (contêiner Docker ou binário compilado), não uma API ou gateway SaaS hospedada
  • Desenvolvedor: Katanemo, segundo a organização do GitHub que hospeda o repositório
  • Repositório: github.com/katanemo/plano, criado em 9 de julho de 2024
  • Licença: Apache 2.0, segundo o arquivo de licença do repositório no GitHub
  • Base: construído sobre o Envoy, o proxy de borda/serviço open source amplamente usado, por contribuidores que trabalharam no próprio Envoy, segundo o README do Plano
  • Escala: mais de 7.050 estrelas no GitHub, 480+ forks e 140 issues abertas no momento desta análise

Histórico do projeto Plano e marcos de versões

O repositório do Plano no GitHub foi criado em julho de 2024, e o projeto tem lançado versões continuamente desde então, adicionando recursos de roteamento de LLM, orquestração de agentes e observabilidade em desenvolvimento ativo. O Plano se posiciona como apoiado pela própria pesquisa de LLM da Katanemo, incluindo o modelo orquestrador dedicado usado para suas decisões de roteamento.

  1. 1
    Repositório criado — 9 de julho de 2024
    Why it matters: O repositório canônico do Plano no GitHub (katanemo/plano) foi criado, segundo os metadados do repositório do GitHub.
  2. 2
    v0.4.36 — 19 de agosto de 2026: versão com tag mais recente no momento desta análise
    Why it matters: A versão mais recente publicada no GitHub no momento desta análise; consulte diretamente a [página de releases](https://github.com/katanemo/plano/releases) para qualquer coisa lançada após a data de publicação desta análise.
  3. 3
    Desenvolvimento contínuo na branch principal
    Why it matters: Os metadados do repositório no GitHub mostram commits enviados à branch principal após a última versão com tag, indicando desenvolvimento contínuo além da última tag de versão — verifique o status atual de releases antes de assumir paridade de recursos com os commits mais recentes.

O que o Plano realmente faz?

O conjunto de recursos do Plano se concentra em tirar as questões de infraestrutura das apps agênticas do código da aplicação e colocá-las em uma camada de proxy compartilhada e auto-hospedada. Veja o que cada parte realmente faz, segundo o próprio README no GitHub e a documentação do Plano.

  • Orquestração de agentes — roteamento de baixa latência entre agentes declarados em uma configuração YAML, sem modificar o código da aplicação; novos agentes podem ser adicionados editando a configuração em vez de reescrever a lógica de roteamento
  • Roteamento de modelos ("Model Agility") — roteia requisições por nome de modelo explícito, alias semântico, ou automaticamente via preferências configuradas, para que o código da aplicação possa chamar um nome de modelo lógico em vez de fixar um provedor específico no código
  • Agentic Signals — termo próprio do Plano para a captura sem código de sinais de uso/comportamento, além de traces e métricas compatíveis com OpenTelemetry emitidos em cada agente que ele faz proxy
  • Filter Chains de guardrail e moderação — um mecanismo configurável para incorporar proteção contra jailbreak, políticas de moderação e comportamento de consistência de memória na camada de proxy em vez de em cada agente individual
  • Modelo de roteamento dedicado — as decisões de roteamento passam pelo próprio modelo "Plano-Orchestrator" do Plano, de cerca de 4 bilhões de parâmetros, em vez de uma chamada a um LLM de propósito geral ou um roteador puramente baseado em regras, segundo o README do Plano
  • Agnóstico a framework e linguagem — os agentes são simplesmente servidores HTTP que implementam um endpoint de chat completions compatível com OpenAI, então o Plano funciona com agentes escritos em qualquer linguagem ou framework de IA
  • Modo gateway de LLM — o Plano também pode ser usado puramente como gateway de roteamento de LLM a partir de serviços de aplicação, independentemente de seus recursos de orquestração de agentes, segundo sua própria documentação

Exemplos de uso: duas formas de usar o Plano

Estes são fluxos de trabalho concretos construídos a partir do próprio exemplo documentado no README do Plano — não casos de uso hipotéticos.

Preço do Plano: ele é mesmo gratuito?

O Plano em si é gratuito e de código aberto (Apache 2.0), sem taxa de licença para auto-hospedá-lo. A nuance está no que alimenta seu roteamento: o Plano e a família de LLMs do Plano (como o Plano-Orchestrator) são hospedados gratuitamente na região US-central pela Katanemo, explicitamente para dar aos desenvolvedores uma primeira experiência sem configuração — segundo o próprio README do projeto, esse nível hospedado gratuito é voltado para desenvolvimento, não para escala de produção.

  • O software do Plano em si: gratuito, de código aberto, licenciado sob Apache 2.0, sem nível pago para o proxy em si
  • Modelos de roteamento/orquestração da família Plano: hospedados gratuitamente em US-central para uma primeira experiência de desenvolvedor, segundo o próprio README do Plano
  • Para rodar em escala de produção, o README da Katanemo afirma que você deve rodar esses modelos de roteamento localmente por conta própria, ou contatar a Katanemo pelo Discord para obter chaves de API hospedadas — nenhuma página pública de preços self-service para essa opção de chaves hospedadas foi encontrada nesta análise
  • Os custos do provedor de LLM são separados: rotear requisições para a OpenAI, Anthropic ou outros provedores via Plano ainda custa o que esse provedor cobra — o Plano em si não adiciona margem, conforme seu papel como camada de roteamento, e não como provedor de modelo

Plano vs. LiteLLM

O Plano e o LiteLLM são ambos camadas auto-hospedadas para gerenciar tráfego de LLM, mas partem de premissas diferentes: o LiteLLM é principalmente uma API/SDK unificada e um proxy para chamar mais de 100 provedores de LLM através de uma interface compatível com OpenAI, enquanto o Plano é construído como um data plane baseado em Envoy com orquestração de agentes como recurso de primeira classe, não apenas roteamento de modelos.

Base principal

Plano vs. LiteLLM:
O Plano é construído sobre o proxy Envoy; o LiteLLM é um SDK e servidor proxy nativo em Python, não baseado em Envoy.

Orquestração de agentes

Plano vs. LiteLLM:
O Plano trata o roteamento multiagente como um recurso central de primeira classe via agentes declarados em YAML; o LiteLLM foca principalmente em roteamento de LLM/provedor, em vez de orquestração agente a agente.

Mecanismo de roteamento

Plano vs. LiteLLM:
O Plano usa um modelo orquestrador dedicado de cerca de 4 bilhões de parâmetros para roteamento baseado em intenção; o LiteLLM roteia principalmente via regras de configuração explícitas, balanceamento de carga e listas de fallback.

Observabilidade

Plano vs. LiteLLM:
O Plano chama sua telemetria de "Agentic Signals" mais OpenTelemetry; o LiteLLM oferece rastreamento de uso, logs de gastos e integrações com ferramentas de observabilidade como o Langfuse.

Licença

Plano vs. LiteLLM:
Ambos têm licença Apache 2.0 para sua oferta principal de código aberto, segundo o próprio repositório de cada projeto.

As duas ferramentas são auto-hospedadas e gratuitas em seu núcleo; a escolha prática depende de você precisar de infraestrutura de proxy de nível Envoy e orquestração nativa de agentes (Plano) ou de um gateway mais simples focado em roteamento de provedores, com uma lista ampla de compatibilidade (LiteLLM). Verifique a paridade atual de recursos na documentação de cada projeto antes de escolher, já que ambos lançam atualizações com frequência.

Quem deveria usar o Plano?

O Plano ser ou não indicado depende de você estar construindo aplicações agênticas que precisam de infraestrutura compartilhada para roteamento, observabilidade e guardrails, em vez de uma única chamada simples a um LLM.

Concorrentes e alternativas

O Plano é mais frequentemente comparado ao LiteLLM, AIClient2API e Langfuse — seu principal diferencial é ser um data plane baseado em Envoy com orquestração nativa multiagente, em vez de uma biblioteca de roteamento puramente em nível de aplicação ou uma ferramenta só de observabilidade.

Tool
Best known for
Link
LiteLLMProxy/SDK unificado para chamar mais de 100 provedores de LLM através de uma API compatível com OpenAIAnálise do LiteLLM
AIClient2APIProxy local leve que converte vários protocolos de clientes de IA em endpoints de API unificadosAnálise do AIClient2API
LangfusePlataforma open source de observabilidade, rastreamento e avaliação de LLMAnálise do Langfuse

Esta lista reflete ferramentas frequentemente comparadas ao Plano no espaço de roteamento/gateway/observabilidade, não um ranking independente da PromptQuorum — veja o Diretório de Software LLM Local para o catálogo completo e regularmente atualizado, incluindo a própria entrada do Plano. Verifique o preço e o conjunto de recursos atuais de cada ferramenta antes de escolher.

Erros comuns ao avaliar o Plano

A maior parte da confusão sobre o Plano vem do seu nome genérico, de assumir que é um SaaS hospedado, ou de expectativas pouco claras sobre o que "gratuito" cobre.

Perguntas frequentes

O que é o Plano?

O Plano (github.com/katanemo/plano) é um servidor proxy e data plane nativo de IA, gratuito e de código aberto (Apache 2.0), baseado em Envoy, para aplicações agênticas, desenvolvido pela Katanemo, que cuida de roteamento de LLM, orquestração de agentes, observabilidade e guardrails.

O Plano é gratuito?

Sim, o Plano em si é gratuito e de código aberto, sem taxa de licença para auto-hospedá-lo. A Katanemo também hospeda gratuitamente os próprios modelos de roteamento/orquestração do Plano na região US-central para uma primeira experiência de desenvolvedor; usar esses modelos em escala de produção exige auto-hospedá-los ou obter chaves de API hospedadas pelo Discord.

Como instalo o Plano?

Siga o próprio guia de início rápido do Plano para instalar os pré-requisitos, e então execute planoai up config.yaml apontando para uma configuração YAML que declare seus agentes e provedores de modelo.

O Plano é um serviço hospedado ou software auto-hospedado?

O Plano é auto-hospedado: você mesmo o implanta como um contêiner Docker ou binário compilado, junto com seus próprios agentes e serviços. A Katanemo hospeda separadamente os próprios modelos orquestradores pequenos do Plano gratuitamente no nível de uso de desenvolvimento.

O que o Plano realmente roteia?

O Plano roteia tráfego de LLM e de agentes: ele pode rotear entre múltiplos agentes com base na intenção, e rotear chamadas de API de LLM para um modelo específico por nome explícito, alias semântico, ou seleção automática baseada em preferências.

O Plano é construído sobre o Envoy?

Sim, segundo seu próprio README, o Plano é construído sobre o Envoy por contribuidores que trabalharam no próprio Envoy, funcionando como um data plane fora do processo, em vez de uma biblioteca em processo.

Quem desenvolve o Plano?

A Katanemo desenvolve o Plano, segundo a organização do GitHub que hospeda o repositório katanemo/plano.

O Plano funciona com qualquer linguagem de programação ou framework?

Sim — os agentes só precisam implementar um endpoint HTTP de chat completions compatível com OpenAI, então o Plano funciona com agentes escritos em qualquer linguagem ou framework de IA, segundo sua própria documentação.

O Plano exige seu próprio modelo para funcionar?

As decisões de roteamento do Plano passam pelo seu próprio modelo orquestrador dedicado, de cerca de 4 bilhões de parâmetros, mas as respostas de LLM que seus agentes realmente usam podem vir de qualquer provedor configurado (OpenAI, Anthropic, modelos locais e outros) para o qual o Plano roteia o tráfego.

Como o Plano é diferente do LiteLLM?

O Plano é um data plane baseado em Envoy com orquestração nativa multiagente como recurso central; o LiteLLM é um SDK/proxy nativo em Python focado principalmente em unificar chamadas a mais de 100 provedores de LLM. Veja a comparação Plano vs. LiteLLM acima para mais detalhes.

A PromptQuorum testou de forma independente as afirmações do Plano?

Esta análise se baseia no próprio repositório do GitHub, README e documentação do Plano, e não em testes práticos realizados pela PromptQuorum.

Fontes

← Voltar para LLMs locais avançados