Skip to main content
PromptQuorum
Início/LLMs locais/Melhor ferramenta de avaliacao de LLM 2026: Braintrust, Weave ou Promptfoo
Tools & Interfaces

Melhor ferramenta de avaliacao de LLM 2026: Braintrust, Weave ou Promptfoo

·13 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

Esta página contém links de referência para produtos de terceiros. O PromptQuorum não está inscrito em nenhum programa de afiliados — são links simples que não geram comissão. Clicar nos links e os próximos passos são de sua inteira responsabilidade. Estes links não representam qualquer endosso ou verificação por parte do PromptQuorum.

O Braintrust e a plataforma de avaliacao mais completa para times que levam recursos de LLM a producao: gratuito ate 10.000 pontuacoes por mes e US$ 249 no Pro. O Weave e a escolha natural se voce ja usa o Weights & Biases, a partir de US$ 60 por mes, mas restrito a organizacoes com menos de 50 funcionarios. O Promptfoo e a melhor opcao gratuita e nativa de CI: licenca MIT, gratuito em qualquer escala porque roda nas suas proprias maquinas, e desde marco de 2026 propriedade da OpenAI, que se comprometeu publicamente a mante-lo de codigo aberto sob a licenca atual.

Key Takeaways

  • Braintrust — nivel Starter gratuito com 10.000 pontuacoes por mes, 1 GB de dados processados, 14 dias de retencao, US$ 10 de credito de modelo e usuarios ilimitados. O Pro custa US$ 249 por mes e inclui US$ 249 de credito de modelo, 5 GB de dados, 50.000 pontuacoes e 30 dias de retencao. O Enterprise acrescenta retencao personalizada e implantacao on-premise ou hospedada.
  • Weave — parte do Weights & Biases. O nivel gratuito da assentos Weave ilimitados e 1 GB por mes de ingestao. O Pro comeca em US$ 60 por mes com 1,5 GB, mas a elegibilidade e explicitamente limitada a "early-stage teams fewer than 50 employees"; organizacoes maiores precisam migrar para o Enterprise. A ingestao adicional custa US$ 0,10 por MB.
  • Promptfoo — 24,6 mil estrelas no GitHub, licenca MIT e gratuito em qualquer escala porque funciona como CLI e biblioteca sobre infraestrutura que voce ja possui. Seu unico custo e o gasto de API do modelo consumido pelas proprias avaliacoes, que qualquer fluxo com LLM como juiz gera em qualquer plataforma.
  • A OpenAI anunciou a aquisicao do Promptfoo em 9 de marco de 2026 e declarou publicamente: "Promptfoo will remain open source under the current license, and we will continue to service and support current customers." O repositorio segue sob MIT e recebeu mudancas no dia em que esta pagina foi verificada.
  • Uma correcao que vale fazer: varios textos descrevem o credito de modelo do Braintrust Pro como uma tarifa promocional que cai para US$ 100 por mes apos 1 de setembro de 2026. Nenhum vencimento desse tipo aparece na pagina de precos do Braintrust. A unica promocao listada e "6–12 months free for qualifying startups". Orce pela pagina do fornecedor.
  • O Promptfoo e tanto ferramenta de seguranca quanto de avaliacao. Sua propria descricao comeca por red teaming, testes de intrusao e analise de vulnerabilidades, e a OpenAI enquadrou a aquisicao em torno de testes de seguranca de agentes. E uma diferenca real de enfase em relacao a Braintrust e Weave.
  • Nenhuma das tres tem programa publico de afiliados ou indicacao para criadores de conteudo. O Weights & Biases mantem um programa de parceiros, mas e um esquema de revenda e integracao tecnologica voltado a consultorias, nao um pagamento por indicacao. A PromptQuorum nao ganha nada com esta pagina.

🏆 A melhor escolha para o seu caso

Escolha por onde a avaliacao roda e quem le os resultados, nao pela lista de recursos de pontuacao: as tres cobrem as mesmas primitivas. Leia para baixo e pare na primeira linha que descreva voce.

  • Pessoas que nao programam precisam revisar as falhas → Braintrust. A interface hospedada, as filas de revisao humana e o versionamento de conjuntos de dados existem exatamente para isso, e o nivel gratuito cobre a maior parte do volume inicial.
  • Voce ja usa o Weights & Biases → Weave. As avaliacoes aparecem ao lado do seu acompanhamento de experimentos, e o nivel gratuito da assentos ilimitados. Verifique o limite de 50 funcionarios antes de contar com o Pro.
  • Voce quer avaliacoes como configuracao versionada sem fornecedor → Promptfoo. YAML ou JS ao lado do seu codigo, comparavel em um pull request, gratuito em qualquer escala.
  • Voce testa injecao de prompt e seguranca de agentes, nao apenas qualidade → Promptfoo. Red teaming e analise de vulnerabilidades sao seu proposito declarado; veja ferramentas de seguranca de prompt e testes de injecao.
  • Voce tem um punhado de casos de teste e uma unica engenheira → nenhuma ainda. Um script pontuado na CI basta ate o conjunto de dados ficar grande o bastante para exigir gestao.
Braintrust — ver precoslink de produto · divulgadoPromptfoo — repositorio de codigo abertolink de produto · divulgado

O que uma ferramenta de avaliacao de LLM realmente faz

Uma ferramenta de avaliacao de LLM passa um conjunto de casos de teste pelo seu prompt ou agente e pontua cada saida, para que voce saiba se uma mudanca melhorou ou piorou as coisas antes de chegar aos usuarios. Um conjunto de dados costuma ser uma serie de pares de entrada e saida esperada, extraidos de registros de producao, escritos a mao como casos limite ou gerados. Os avaliadores vao de verificacoes deterministas como comparacao de strings e validacao de esquema JSON, passando pela nota com LLM como juiz, em que um segundo modelo pontua contra uma rubrica, ate funcoes proprias que voce escreve.

Esse e um trabalho diferente de observar o que o sistema faz depois de no ar. A avaliacao responde "esta mudanca pode ir para producao?"; o monitoramento responde "o que ele esta fazendo agora?". Esta pagina trata da primeira pergunta. Para a visao no nivel do prompt, veja como avaliar a qualidade de um prompt.

Uma ferramenta de avaliacao de LLM passa um conjunto fixo de casos de teste pelo seu prompt ou agente, pontua cada saida com verificacoes deterministas, nota por LLM como juiz ou funcoes proprias, e informa se uma mudanca melhorou ou degradou a qualidade antes do lancamento.

E uma suite de testes para algo que nunca da a mesma resposta duas vezes. Em vez de conferir uma saida exata, voce a pontua e observa se a media anda na direcao errada quando muda um prompt.

Braintrust, Weave e Promptfoo comparados

As tres fazem LLM como juiz, avaliadores proprios e testes de regressao sobre conjuntos de dados, entao a comparacao e sobre modelo de hospedagem, estrutura de custo e elegibilidade. Os precos foram lidos nas paginas de cada fornecedor em 28 de agosto de 2026, e os numeros de repositorio na API do GitHub no mesmo dia.

CriterioBraintrustWeavePromptfoo
ModeloPlataforma hospedada com interfaceHospedada, parte do W&BCLI e biblioteca que voce executa
LicencaComercialSDK Apache-2.0, servico hospedadoMIT
Nivel gratuito10.000 pontuacoes/mes, 1 GB, 14 dias1 GB/mes de ingestao, assentos ilimitadosGratuito em qualquer escala
Entrada pagaPro US$ 249/mes, US$ 249 de creditoA partir de US$ 60/mes, 1,5 GBNivel Enterprise, sob medida
Limite de elegibilidadeNenhum declaradoPro so abaixo de 50 funcionariosNenhum
ExcedenteUS$ 1,50 por 1.000 pontuacoes no ProUS$ 0,10 por MB de ingestaoSo o gasto de API do modelo
Auto-hospedagemEnterprise, on-premise ou hospedadaEnterprise, inquilino unicoPadrao — roda nas suas maquinas
Programa de afiliadosNao encontradoNao encontradoNao encontrado

⚠️Warning: O nivel Pro do Weave nao e apenas um plano mais barato: o Weights & Biases afirma que ele e "for early-stage teams fewer than 50 employees" e que clientes que excedam essas diretrizes precisam migrar para o Enterprise. Acima desse quadro, a comparacao real e Braintrust Pro a US$ 249 contra um orcamento Enterprise sob medida, nao contra US$ 60.

Braintrust: a escolha de producao

O Braintrust e o que se escolhe quando pessoas que nao escrevem codigo precisam olhar os resultados da avaliacao. Seu valor se concentra na interface hospedada, no versionamento de conjuntos de dados e no fluxo de revisao humana, justamente a parte que de outro modo voce teria de construir.

1

Braintrust — melhor para times de producao multidisciplinares

Gratuito ate 10.000 pontuacoes por mes, Pro US$ 249 com US$ 249 de credito incluso

O nivel Starter gratuito e incomumente generoso para uma plataforma hospedada: 10.000 pontuacoes por mes, 1 GB de dados processados, 14 dias de retencao, US$ 10 de credito de modelo e usuarios, projetos, conjuntos de dados e experimentos ilimitados. Assentos ilimitados num nivel gratuito importam aqui, porque a razao inteira de escolher o Braintrust e deixar gerentes de produto e especialistas de dominio revisarem falhas sem comprar licencas para eles. O Pro, a US$ 249 por mes, eleva isso a 50.000 pontuacoes, 5 GB e 30 dias de retencao, e inclui US$ 249 de credito de modelo, o que compensa boa parte do gasto do modelo juiz numa carga media. O excedente e cobrado em vez de bloquear: US$ 1,50 por 1.000 pontuacoes e US$ 3 por GB no Pro. O Enterprise acrescenta retencao e exportacao personalizadas, RBAC e implantacao on-premise ou hospedada.

Vantagens

  • +Usuarios ilimitados ja no nivel gratuito, que e exatamente o ponto
  • +O nivel gratuito de 10.000 pontuacoes por mes cobre de fato projetos iniciais
  • +O Pro inclui US$ 249 de credito de modelo, compensando boa parte do gasto do juiz
  • +Implantacao on-premise ou hospedada disponivel para cargas sensiveis

Desvantagens

  • 14 dias de retencao no gratuito e pouco para comparar com o mes passado
  • A auto-hospedagem exige Enterprise e conversa comercial, sem preco publicado
  • Plataforma comercial: diferente do Promptfoo, nao ha alternativa se os precos mudarem
Braintrust — ver precoslink de produto · divulgado

Weave: a escolha do Weights & Biases

O Weave e a resposta obvia se seu time ja acompanha experimentos no Weights & Biases, e uma venda mais dificil se nao acompanha. A integracao e o argumento: as avaliacoes chegam ao lado das execucoes que voce ja olha.

1

Weave — melhor dentro do ecossistema Weights & Biases

Gratuito 1 GB por mes com assentos ilimitados, Pro a partir de US$ 60 abaixo de 50 funcionarios

O Weave cobre avaliacoes de aplicacoes, rastreamento e avaliadores, e o nivel gratuito da assentos Weave ilimitados com 1 GB por mes de ingestao, um ponto de partida razoavel para um time pequeno. O Pro comeca em US$ 60 por mes com cobranca mensal e 1,5 GB, e a ingestao adicional custa US$ 0,10 por MB. O detalhe esta na elegibilidade mais que no preco: o Weights & Biases afirma que o Pro e "for early-stage teams fewer than 50 employees" e que quem exceder essas diretrizes precisa migrar para o Enterprise. E no Enterprise que ficam as opcoes serias de implantacao, incluindo inquilino unico, conformidade HIPAA, chaves de criptografia gerenciadas pelo cliente, SSO e registros de auditoria. Note que inquilino unico se aproxima mais de uma instancia dedicada do que de um verdadeiro on-premise, entao confirme os detalhes com o W&B antes de supor que atende a uma exigencia estritamente on-premise.

Vantagens

  • +Nivel gratuito com assentos Weave ilimitados e 1 GB por mes de ingestao
  • +As avaliacoes convivem com o acompanhamento de experimentos e o registro do W&B
  • +O Enterprise oferece inquilino unico, HIPAA, chaves gerenciadas pelo cliente e SSO
  • +Com US$ 60 por mes, a entrada paga mais baixa das tres

Desvantagens

  • O Pro e restrito a organizacoes com menos de 50 funcionarios, um teto rigido
  • A cobranca por ingestao a US$ 0,10/MB e mais dificil de prever que uma contagem de pontuacoes
  • O argumento isolado mais fraco se voce ainda nao usa o Weights & Biases
Weave — ver precos do Weights & Biaseslink de produto · divulgado

Promptfoo: a escolha gratuita e nativa de CI

O Promptfoo e o que nao custa nada em escala alguma, porque voce mesmo o executa. E uma CLI e biblioteca, nao uma plataforma, entao as avaliacoes vivem como configuracao ao lado do seu codigo e rodam onde seus testes ja rodam.

1

Promptfoo — melhor opcao gratuita e nativa de CI

24,6 mil estrelas, licenca MIT, gratuito em qualquer escala, agora propriedade da OpenAI

O Promptfoo tem 24.638 estrelas no GitHub e licenca MIT, e recebeu mudancas no dia em que esta pagina foi verificada, entao sua atividade e inequivoca. Como roda sobre infraestrutura que voce ja possui, nao ha medidor por pontuacao nem por gigabyte: seu unico custo sao as chamadas de API do modelo que as avaliacoes consomem, que voce pagaria em qualquer plataforma. Definir conjuntos de dados como YAML, CSV ou JS da mais trabalho que clicar numa interface, mas deixa as avaliacoes comparaveis num pull request, uma vantagem real quando a configuracao deve ser revisada como qualquer outro codigo. Vale saber o que ele e de fato: o projeto se descreve como teste de prompts, agentes e RAG, com red teaming, testes de intrusao e analise de vulnerabilidades para IA. Seguranca aqui nao e recurso secundario, e a OpenAI enquadrou sua aquisicao em torno de testes de seguranca de agentes.

Vantagens

  • +Gratuito em qualquer escala, sem medidor de pontuacoes nem de ingestao
  • +Avaliacoes como configuracao versionada, comparavel e revisavel num pull request
  • +Licenca MIT: nenhum fornecedor do qual depender se as condicoes mudarem
  • +Red teaming e analise de vulnerabilidades sao de primeira classe, nao acrescimo

Desvantagens

  • Sem interface hospedada por padrao: quem nao programa nao tem onde clicar
  • Conjuntos de dados em YAML e CSV dao mais trabalho que monta-los num navegador
  • Agora propriedade da OpenAI, o que e uma consideracao de governanca mesmo com o compromisso de codigo aberto
Promptfoo — repositorio de codigo abertolink de produto · divulgado

O que a aquisicao pela OpenAI significa para o Promptfoo

A OpenAI anunciou que adquiria o Promptfoo em 9 de marco de 2026, e se comprometeu publicamente a mante-lo de codigo aberto. A declaracao da propria OpenAI diz: "Promptfoo will remain open source under the current license, and we will continue to service and support current customers." A aquisicao foi noticiada na epoca por TechCrunch, CNBC e Forbes, e confirmada nos sites da OpenAI e do Promptfoo.

As evidencias praticas sustentam o compromisso ate agora. Quase seis meses depois, o repositorio segue sob a organizacao `promptfoo`, segue com licenca MIT e recebeu mudancas no dia em que esta pagina foi verificada. E o que se quer ver.

O motivo para pensar no assunto mesmo assim e governanca, nao licenca. Uma ferramenta de avaliacao e aquilo com que voce julga modelos, e agora pertence a uma empresa que fabrica modelos. A licenca MIT significa que voce pode bifurcar o projeto se o rumo dele deixar de servi-lo, uma protecao real que Braintrust e Weave nao oferecem. Mas se sua estrategia de avaliacao depende de neutralidade entre fornecedores de modelos, isso merece uma decisao deliberada e nao uma suposicao.

📌Note: A OpenAI afirmou que a tecnologia do Promptfoo sera integrada ao OpenAI Frontier para red teaming automatizado e testes de seguranca de agentes. Isso e coerente com a enfase de seguranca que o Promptfoo ja tinha, e sugere que esse lado devera receber mais investimento que a avaliacao de proposito geral.

Como os precos se comparam

O custo escala com volume de dados e gasto do modelo juiz, nao com assentos — e por isso usuarios ilimitados nos niveis gratuitos sao mais uteis do que parece a principio. A tabela calcula uma carga media de cerca de 50.000 pontuacoes de avaliacao por mes.

CenarioBraintrustWeavePromptfoo
Limite do nivel gratuito10.000 pontuacoes, 1 GB, 14 dias1 GB/mes de ingestao, assentos ilimitadosSem limite
Nivel pagoPro US$ 249/mesA partir de US$ 60/mesNao e necessario
Incluso nesse nivel50.000 pontuacoes, 5 GB, US$ 249 credito1,5 GB de ingestaoNao se aplica
50.000 pontuacoes por mesCoberto pelo Pro a US$ 249Depende dos GB, provavelmente acima de 1,5So gasto de API do modelo
Tarifa de excedenteUS$ 1,50 por 1.000 pontuacoes, US$ 3/GBUS$ 0,10 por MBNenhuma
Teto de elegibilidadeNenhum declaradoPro abaixo de 50 funcionariosNenhum

O Braintrust cobra por pontuacao e o Weave por gigabyte ingerido. Nao sao unidades comparaveis, entao estime as duas com sua propria carga antes de tratar US$ 60 como mais barato que US$ 249.

⚠️Warning: Varios comparativos afirmam que os US$ 249 de credito do Braintrust Pro sao uma promocao de 2026 que cai para US$ 100 por mes apos 1 de setembro de 2026. Esse vencimento nao aparece na pagina de precos do Braintrust, que lista apenas "6–12 months free for qualifying startups" como promocao. Calcule pela pagina do fornecedor e nao por um artigo comparativo, este incluido.

Auto-hospedagem e residencia de dados

O Promptfoo e o unico dos tres em que a auto-hospedagem e o padrao e nao um upgrade empresarial. Por ser CLI e biblioteca, seus casos de teste e as saidas do modelo nunca deixam seu ambiente, salvo se voce escolher deliberadamente um nivel hospedado. Para um time sob regras de residencia de dados, isso elimina a pergunta em vez de responde-la.

O Braintrust oferece implantacao on-premise ou hospedada, mas so no Enterprise, o que significa preco sob medida e conversa comercial. E uma opcao real de implantacao e nao uma frase de marketing, mas voce nao consegue avalia-la em autoatendimento.

O nivel Enterprise do Weave oferece uma opcao de inquilino unico com chaves de criptografia gerenciadas pelo cliente, conformidade HIPAA e conectividade privada segura. Leia com atencao: inquilino unico com chaves proprias e uma instancia dedicada, o que nao e a mesma coisa que rodar dentro do seu proprio perimetro. Se sua exigencia e estritamente on-premise, confirme os detalhes com o Weights & Biases em vez de supor que a opcao de inquilino unico a satisfaz.

Quem deve usar o que

O formato do time decide isso mais que listas de recursos. Cinco perfis cobrem a maioria dos leitores.

  • Desenvolvedora sozinha num MVP → Promptfoo. Sem conta, sem medidor e sem nada a remover se o projeto mudar de rumo.
  • Time de produto lancando um recurso de LLM com revisao de PM e QA → Braintrust. Os usuarios ilimitados do nivel gratuito sao o ponto concreto que torna a revisao multidisciplinar viavel.
  • Time que ja usa o Weights & Biases → Weave, desde que esteja abaixo de 50 funcionarios para o Pro. Acima disso, orce o Enterprise antes de comparar.
  • Time de seguranca ou plataforma testando injecao de prompt → Promptfoo, cujo foco em red teaming combina com a tarefa. Veja tambem ferramentas de seguranca de prompt e testes de injecao.
  • Time avaliando varios fornecedores de modelos → Promptfoo ou Braintrust, e roteie as chamadas por um gateway para que comparar fornecedores seja uma mudanca de configuracao; veja o melhor gateway de API para LLM.

Ferramentas de avaliacao na UE, no Japao e na China

Conjuntos de dados de avaliacao costumam ser construidos a partir do trafego de producao, o que os torna alguns dos dados mais sensiveis de uma pilha de LLM. Isso transforma a escolha entre hospedado e local numa questao de conformidade em tres mercados importantes.

Erros comuns ao escolher uma ferramenta de avaliacao

  1. 1
    Comparar US$ 60 com US$ 249 sem checar a elegibilidade
    Why it matters: O Weave Pro e restrito a organizacoes com menos de 50 funcionarios. Acima desse quadro, a comparacao real e Braintrust Pro contra um orcamento Weave Enterprise sob medida, e o numero de US$ 60 nao esta disponivel para voce.
  2. 2
    Orcar em torno de um vencimento promocional do Braintrust que nao esta publicado
    Why it matters: A afirmacao de que os creditos do Pro caem para US$ 100 por mes apos 1 de setembro de 2026 nao aparece na pagina de precos do Braintrust. Planejar uma migracao em torno de um vencimento que o fornecedor nao anunciou desperdica esforco; releia a pagina de precos.
  3. 3
    Tratar pontuacoes e gigabytes como unidades comparaveis
    Why it matters: O Braintrust mede pontuacoes e o Weave mede ingestao. Uma carga que cabe folgada em 50.000 pontuacoes pode ou nao caber em 1,5 GB conforme o tamanho dos seus rastros. Estime as duas com seus proprios dados antes de ordenar por preco.
  4. 4
    Adotar uma plataforma para um conjunto de quinze casos
    Why it matters: Abaixo de cerca de vinte casos de teste, um script pontuado na CI faz o mesmo trabalho sem conta, sem medidor e sem limite de retencao. Plataformas se justificam quando o gargalo e a gestao do conjunto de dados, nao a pontuacao.
  5. 5
    Supor que inquilino unico significa on-premise
    Why it matters: A opcao Enterprise de inquilino unico do Weave com chaves gerenciadas pelo cliente e uma instancia dedicada, nao uma implantacao dentro do seu proprio perimetro. Se sua exigencia e estritamente on-premise, confirme com o W&B em vez de ler inquilino unico como equivalente.

Pule isto se…

Se seu conjunto de testes tem uma duzia de prompts e uma unica engenheira o executa, pule as tres e escreva um script pontuado na CI. Voce obtem o mesmo sinal de regressao sem conta, medidor ou janela de retencao, e podera migrar para uma plataforma depois sem ter perdido nada, porque o ativo e o conjunto de dados e ele vai com voce.

O limiar que vale esperar e quando gerenciar o conjunto de dados vira o trabalho: quando voce quer levar casos com falha da producao para o conjunto de testes rotineiramente, quando alguem que nao programa precisa dar nota as saidas, ou quando precisa comparar os resultados deste mes com os do trimestre passado. Esses sao problemas de gestao de dados, e e isso que voce esta de fato comprando. A pontuacao em si sempre foi a parte facil.

💡Tip: Um gatilho pratico: adote uma plataforma na primeira vez que se pegar montando uma planilha para acompanhar qual versao do prompt pontuou o que. Essa planilha e o produto que voce esta prestes a comprar, e compra-lo sai mais barato que mante-lo.

Perguntas frequentes

Qual e a melhor ferramenta de avaliacao de LLM em 2026?

Braintrust para times em que pessoas nao tecnicas revisam resultados, gracas aos usuarios ilimitados ja no nivel gratuito. Weave se voce ja usa o Weights & Biases e esta abaixo de 50 funcionarios. Promptfoo se quer avaliacoes como configuracao versionada rodando de graca na sua propria infraestrutura. As tres cobrem LLM como juiz, avaliadores proprios e testes de regressao.

A OpenAI adquiriu o Promptfoo?

Sim. A OpenAI anunciou a aquisicao em 9 de marco de 2026 e declarou que o Promptfoo continuara de codigo aberto sob sua licenca atual e que os clientes existentes seguirao com servico e suporte. No fim de agosto de 2026 o repositorio segue sob a organizacao promptfoo, segue com licenca MIT e e mantido ativamente.

Quanto custa o Braintrust?

O nivel Starter gratuito inclui 10.000 pontuacoes por mes, 1 GB de dados processados, 14 dias de retencao, US$ 10 de credito de modelo e usuarios ilimitados. O Pro custa US$ 249 por mes e inclui US$ 249 de credito, 50.000 pontuacoes, 5 GB e 30 dias de retencao, com excedente a US$ 1,50 por 1.000 pontuacoes. O Enterprise tem preco sob medida e acrescenta implantacao on-premise ou hospedada.

O Weave e gratuito e quais sao os limites?

O Weave tem um nivel gratuito com assentos ilimitados e 1 GB por mes de ingestao de dados. O Pro comeca em US$ 60 por mes com 1,5 GB, mas o Weights & Biases o restringe a times em estagio inicial com menos de 50 funcionarios; organizacoes maiores precisam migrar para o Enterprise. A ingestao adicional custa US$ 0,10 por MB.

O Promptfoo e mesmo gratuito em qualquer escala?

Sim, no sentido de que a ferramenta tem licenca MIT e roda nas suas proprias maquinas, entao nao ha cobranca por pontuacao nem por gigabyte. Voce ainda paga as chamadas de API do modelo feitas pelas avaliacoes, mas esse custo existe em qualquer plataforma e nao e especifico do Promptfoo. Ha ainda um nivel Enterprise hospedado opcional por cima.

Qual posso auto-hospedar?

O Promptfoo por padrao, ja que e CLI e biblioteca e roda onde voce o executar. O Braintrust oferece implantacao on-premise ou hospedada no plano Enterprise. O Weave oferece uma opcao Enterprise de inquilino unico com chaves gerenciadas pelo cliente, que e uma instancia dedicada e nao um verdadeiro on-premise, entao confirme os detalhes se tiver exigencia estrita.

Alguma delas tem programa de afiliados?

Nao encontramos programa publico de afiliados ou indicacao para criadores no Braintrust, Weights & Biases nem Promptfoo. O Weights & Biases mantem um programa de parceiros, mas sua pagina publica descreve parcerias de revenda e integracao tecnologica voltadas a consultorias, nao um pagamento por indicacao. Note tambem que usebraintrust.com e um marketplace de talentos separado, sem relacao com braintrust.dev. A PromptQuorum nao ganha nada com esta pagina.

Qual a diferenca entre avaliacao e monitoramento?

A avaliacao roda um conjunto fixo de dados antes do lancamento e diz se uma mudanca melhorou ou degradou a qualidade. O monitoramento observa o trafego real depois do lancamento e diz o que o sistema esta fazendo agora. Esta pagina cobre o primeiro. Os dois se complementam e muitos times fazem ambos, mas as ferramentas e as perguntas sao diferentes.

Veredito final

  • Use o Braintrust se pessoas que nao escrevem codigo precisam revisar os resultados — proximo passo: comece pelo nivel gratuito, que permite usuarios ilimitados, e veja se seus PMs realmente o abrem antes de pagar o Pro.
  • Use o Weave se o Weights & Biases ja for seu sistema de registro — proximo passo: confirme que esta abaixo do teto de 50 funcionarios antes de contar com o nivel de US$ 60, e orce o Enterprise se nao estiver.
  • Use o Promptfoo se quer avaliacoes como configuracao revisavel sem medidor de fornecedor — proximo passo: escreva seu primeiro conjunto de dados em YAML e rode-o na CI antes de avaliar qualquer coisa hospedada.
  • Use o Promptfoo especificamente se esta testando injecao de prompt e seguranca de agentes e nao apenas qualidade de saida — proximo passo: comece pelos recursos de red teaming, para onde a OpenAI esta direcionando investimento.
  • Pule as tres se voce tem uma duzia de casos de teste e uma unica engenheira — proximo passo: escreva um script pontuado na CI e reveja quando gerenciar o conjunto de dados virar o gargalo.

Fontes

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs