Key Takeaways
- Braintrust — nivel Starter gratuito con 10.000 puntuaciones al mes, 1 GB de datos procesados, 14 días de retención, 10 $ de crédito de modelo y usuarios ilimitados. Pro cuesta 249 $ al mes e incluye 249 $ de crédito de modelo, 5 GB de datos, 50.000 puntuaciones y 30 días de retención. Enterprise añade retención personalizada y despliegue on-premise o alojado.
- Weave — parte de Weights & Biases. El nivel gratuito da plazas ilimitadas de Weave y 1 GB al mes de ingesta. Pro parte de 60 $ al mes con 1,5 GB, pero la elegibilidad se limita explícitamente a «early-stage teams fewer than 50 employees»; las organizaciones mayores deben pasar a Enterprise. La ingesta adicional cuesta 0,10 $ por MB.
- Promptfoo — 24,6k estrellas en GitHub, licencia MIT y gratuito a cualquier escala porque funciona como CLI y biblioteca sobre infraestructura que ya posee. Su único coste es el gasto de API del modelo que consumen las propias evaluaciones, algo que ocurre en cualquier plataforma con LLM como juez.
- OpenAI anunció la adquisición de Promptfoo el 9 de marzo de 2026 y declaró públicamente: «Promptfoo will remain open source under the current license, and we will continue to service and support current customers». El repositorio sigue siendo MIT y recibió cambios el día en que se comprobó esta página.
- Una corrección que conviene hacer: varios artículos describen el crédito de modelo de Braintrust Pro como una tarifa promocional que baja a 100 $ al mes tras el 1 de septiembre de 2026. Ese vencimiento no aparece en la página de precios de Braintrust. La única promoción que figura es «6–12 months free for qualifying startups». Presupueste desde la página del proveedor.
- Promptfoo es tanto una herramienta de seguridad como de evaluación. Su propia descripción empieza por red teaming, pruebas de penetración y análisis de vulnerabilidades, y OpenAI enmarcó la adquisición en torno a las pruebas de seguridad de agentes. Es una diferencia real de énfasis frente a Braintrust y Weave.
- Ninguna de las tres tiene programa público de afiliados o referidos para creadores de contenido. Weights & Biases sí tiene un programa de partners, pero es un esquema de reventa e integración tecnológica dirigido a consultoras, no un pago por referido. PromptQuorum no gana nada con esta página.
🏆 La mejor opción para su caso
Elija por dónde se ejecuta la evaluación y quién lee los resultados, no por la lista de funciones de puntuación: las tres cubren las mismas primitivas. Lea hacia abajo y deténgase en la primera línea que le describa.
- Personas que no programan necesitan revisar los fallos → Braintrust. La interfaz alojada, las colas de revisión humana y el versionado de conjuntos de datos existen justo para eso, y el nivel gratuito cubre la mayor parte del volumen inicial.
- Ya usa Weights & Biases → Weave. Las evaluaciones aparecen junto a su seguimiento de experimentos y el nivel gratuito da plazas ilimitadas. Compruebe el límite de 50 empleados antes de contar con Pro.
- Quiere evaluaciones como configuración versionada sin proveedor → Promptfoo. YAML o JS junto a su código, comparable en un pull request y gratuito sea cual sea la escala.
- Está probando inyección de prompts y seguridad de agentes, no solo calidad → Promptfoo. El red teaming y el análisis de vulnerabilidades son su propósito declarado; véase herramientas de seguridad de prompts y pruebas de inyección.
- Tiene un puñado de casos de prueba y una sola ingeniera → ninguna todavía. Un script puntuado en CI basta hasta que el conjunto de datos sea lo bastante grande como para necesitar gestión.
Qué hace realmente una herramienta de evaluación de LLM
Una herramienta de evaluación de LLM pasa un conjunto de casos de prueba por su prompt o agente y puntúa cada salida, para que sepa si un cambio mejora o empeora las cosas antes de que llegue a los usuarios. Un conjunto de datos suele ser una serie de pares de entrada y salida esperada, extraídos de registros de producción, escritos a mano como casos límite o generados. Los evaluadores van desde comprobaciones deterministas como coincidencia de cadenas y validación de esquema JSON, pasando por la calificación con LLM como juez, donde un segundo modelo puntúa contra una rúbrica, hasta funciones propias que usted escribe.
Eso es distinto de observar qué hace el sistema una vez en marcha. La evaluación responde «¿es seguro publicar este cambio?»; la monitorización de producción responde «¿qué está haciendo ahora?». Esta página trata la primera pregunta. Para la vista a nivel de prompt del mismo problema, véase cómo evaluar la calidad de un prompt.
Una herramienta de evaluación de LLM pasa un conjunto fijo de casos de prueba por su prompt o agente, puntúa cada salida con comprobaciones deterministas, calificación con LLM como juez o funciones propias, e informa de si un cambio mejoró o degradó la calidad antes de publicarlo.
Es una batería de pruebas para algo que nunca da dos veces la misma respuesta. En lugar de comprobar una salida exacta, la puntúa y vigila si la media se mueve en la dirección equivocada al cambiar un prompt.
Braintrust, Weave y Promptfoo comparados
Las tres hacen LLM como juez, evaluadores propios y pruebas de regresión sobre conjuntos de datos, así que la comparación va de modelo de alojamiento, estructura de costes y elegibilidad. Los precios se leyeron de las páginas de cada proveedor el 28 de agosto de 2026, y las cifras de repositorio de la API de GitHub ese mismo día.
| Criterio | Braintrust | Weave | Promptfoo |
|---|---|---|---|
| Modelo | Plataforma alojada con interfaz | Alojada, parte de W&B | CLI y biblioteca que usted ejecuta |
| Licencia | Comercial | SDK Apache-2.0, servicio alojado | MIT |
| Nivel gratuito | 10.000 puntuaciones/mes, 1 GB, 14 días | 1 GB/mes de ingesta, plazas ilimitadas | Gratis a cualquier escala |
| Entrada de pago | Pro 249 $/mes, 249 $ de crédito | Desde 60 $/mes, 1,5 GB | Nivel Enterprise, personalizado |
| Límite de elegibilidad | Ninguno declarado | Pro solo con menos de 50 empleados | Ninguno |
| Exceso de uso | 1,50 $ por 1.000 puntuaciones en Pro | 0,10 $ por MB de ingesta | Solo su gasto de API del modelo |
| Autoalojamiento | Enterprise, on-premise o alojado | Enterprise, inquilino único | Por defecto — se ejecuta en sus máquinas |
| Programa de afiliados | No encontrado | No encontrado | No encontrado |
⚠️Warning: El nivel Pro de Weave no es simplemente un plan más barato: Weights & Biases indica que es «for early-stage teams fewer than 50 employees» y que los clientes que superen esas pautas deben pasar a Enterprise. Si supera esa plantilla, la comparación real es Braintrust Pro a 249 $ frente a un presupuesto Enterprise personalizado, no frente a 60 $.
Braintrust: la opción de producción
Braintrust es la elección cuando personas que no escriben código necesitan mirar los resultados de la evaluación. Su valor se concentra en la interfaz alojada, el versionado de conjuntos de datos y el flujo de revisión humana, que es justo la parte que de otro modo tendría que construir.
Braintrust — mejor para equipos de producción multidisciplinares
Gratis hasta 10.000 puntuaciones al mes, Pro 249 $ con 249 $ de crédito incluido
El nivel Starter gratuito es inusualmente generoso para una plataforma alojada: 10.000 puntuaciones al mes, 1 GB de datos procesados, 14 días de retención, 10 $ de crédito de modelo y usuarios, proyectos, conjuntos de datos y experimentos ilimitados. Las plazas ilimitadas en un nivel gratuito importan aquí, porque la razón misma de elegir Braintrust es dejar que responsables de producto y expertos de dominio revisen los fallos sin comprarles licencias. Pro, a 249 $ al mes, eleva eso a 50.000 puntuaciones, 5 GB y 30 días de retención, e incluye 249 $ de crédito de modelo, lo que compensa en buena medida el gasto del modelo juez en una carga mediana. El exceso se cobra en lugar de bloquear: 1,50 $ por 1.000 puntuaciones y 3 $ por GB en Pro. Enterprise añade retención y exportación personalizadas, RBAC y despliegue on-premise o alojado.
Ventajas
- +Usuarios ilimitados incluso en el nivel gratuito, que es justo el sentido de elegirlo
- +El nivel gratuito de 10.000 puntuaciones al mes cubre de verdad los proyectos iniciales
- +Pro incluye 249 $ de crédito de modelo, compensando en gran parte el gasto del modelo juez
- +Despliegue on-premise o alojado disponible para cargas sensibles a la privacidad
Desventajas
- –14 días de retención en el nivel gratuito es poco si quiere comparar con el mes pasado
- –El autoalojamiento exige Enterprise y una conversación comercial, sin precio publicado
- –Plataforma comercial, así que a diferencia de Promptfoo no hay alternativa si cambian los precios
Weave: la opción de Weights & Biases
Weave es la respuesta obvia si su equipo ya sigue experimentos en Weights & Biases, y una venta más difícil si no lo hace. La integración es el argumento: las evaluaciones aparecen junto a las ejecuciones que ya está mirando.
Weave — mejor dentro del ecosistema Weights & Biases
Gratis 1 GB al mes con plazas ilimitadas, Pro desde 60 $ con menos de 50 empleados
Weave cubre evaluaciones de aplicaciones, trazado y evaluadores, y el nivel gratuito da plazas ilimitadas de Weave con 1 GB al mes de ingesta, un punto de partida razonable para un equipo pequeño. Pro parte de 60 $ al mes con facturación mensual y 1,5 GB, y la ingesta adicional cuesta 0,10 $ por MB. El matiz está en la elegibilidad más que en el precio: Weights & Biases indica que Pro es «for early-stage teams fewer than 50 employees» y que quienes superen esas pautas deben pasar a Enterprise. En Enterprise están las opciones de despliegue serias, incluida la opción de inquilino único, cumplimiento HIPAA, claves de cifrado gestionadas por el cliente, SSO y registros de auditoría. Tenga en cuenta que inquilino único se acerca más a una instancia dedicada que a un verdadero on-premise, así que confirme los detalles con W&B antes de dar por hecho que satisface un requisito estricto de on-premise.
Ventajas
- +Nivel gratuito con plazas de Weave ilimitadas y 1 GB al mes de ingesta
- +Las evaluaciones conviven con el seguimiento de experimentos y el registro de W&B
- +Enterprise ofrece inquilino único, HIPAA, claves gestionadas por el cliente y SSO
- +Con 60 $ al mes es la entrada de pago más baja de las tres
Desventajas
- –Pro está restringido a organizaciones de menos de 50 empleados, un techo rígido
- –La facturación por ingesta a 0,10 $/MB es más difícil de prever que un recuento de puntuaciones
- –El argumento independiente más débil si no usa ya Weights & Biases
Promptfoo: la opción gratuita y nativa de CI
Promptfoo es la que no cuesta nada a ninguna escala, porque la ejecuta usted. Es una CLI y una biblioteca más que una plataforma, así que las evaluaciones viven como configuración junto a su código y se ejecutan donde ya se ejecutan sus pruebas.
Promptfoo — mejor opción gratuita y nativa de CI
24,6k estrellas, licencia MIT, gratis a cualquier escala, ahora propiedad de OpenAI
Promptfoo tiene 24.638 estrellas en GitHub y licencia MIT, y recibió cambios el día en que se comprobó esta página, así que su actividad es inequívoca. Como se ejecuta sobre infraestructura que ya posee, no hay contador por puntuación ni por gigabyte: su único coste son las llamadas de API del modelo que consumen las evaluaciones, que pagaría en cualquier plataforma. Definir conjuntos de datos como YAML, CSV o JS supone más fricción que hacer clic en una interfaz, pero deja las evaluaciones comparables en un pull request, una ventaja real cuando la configuración debe revisarse como cualquier otro código. Conviene saber qué es en realidad: el proyecto se describe como pruebas de prompts, agentes y RAG, con red teaming, pruebas de penetración y análisis de vulnerabilidades para IA. La seguridad no es aquí una función secundaria, y OpenAI enmarcó su adquisición en torno a las pruebas de seguridad de agentes.
Ventajas
- +Gratuito a cualquier escala, sin contador de puntuaciones ni de ingesta
- +Evaluaciones como configuración versionada, comparable y revisable en un pull request
- +Licencia MIT, así que no hay proveedor del que depender si cambian las condiciones
- +Red teaming y análisis de vulnerabilidades son de primera clase, no un añadido
Desventajas
- –Sin interfaz alojada por defecto, así que quienes no programan no tienen dónde hacer clic
- –Los conjuntos de datos en YAML y CSV suponen más fricción que construirlos en un navegador
- –Ahora propiedad de OpenAI, lo que es una consideración de gobernanza pese al compromiso de código abierto
Qué significa para Promptfoo la adquisición por OpenAI
OpenAI anunció que adquiría Promptfoo el 9 de marzo de 2026, y se comprometió públicamente a mantenerlo de código abierto. La declaración de OpenAI dice: «Promptfoo will remain open source under the current license, and we will continue to service and support current customers». La adquisición fue recogida entonces por TechCrunch, CNBC y Forbes, y confirmada en las webs de OpenAI y de Promptfoo.
La evidencia sobre el terreno respalda el compromiso por ahora. Casi seis meses después, el repositorio sigue bajo la organización `promptfoo`, sigue con licencia MIT y recibió cambios el día en que se comprobó esta página. Es lo que uno querría ver.
El motivo para pensarlo de todos modos es de gobernanza, no de licencia. Una herramienta de evaluación es aquello con lo que juzga modelos, y ahora pertenece a una empresa que fabrica modelos. La licencia MIT significa que puede bifurcar el proyecto si su rumbo deja de servirle, una protección real que Braintrust y Weave no ofrecen. Pero si su estrategia de evaluación depende de la neutralidad entre proveedores de modelos, eso merece una decisión deliberada y no un supuesto.
📌Note: OpenAI señaló que la tecnología de Promptfoo se integrará en OpenAI Frontier para red teaming automatizado y pruebas de seguridad de agentes. Es coherente con el énfasis de seguridad que ya tenía Promptfoo, y sugiere que ese lado recibirá más inversión que la evaluación de propósito general.
Cómo se comparan los precios
El coste escala con el volumen de datos y el gasto del modelo juez, no con las plazas, y por eso los usuarios ilimitados de los niveles gratuitos son más útiles de lo que parece. La tabla calcula una carga mediana de unas 50.000 puntuaciones de evaluación al mes.
| Escenario | Braintrust | Weave | Promptfoo |
|---|---|---|---|
| Límite del nivel gratuito | 10.000 puntuaciones, 1 GB, 14 días | 1 GB/mes de ingesta, plazas ilimitadas | Sin límite |
| Nivel de pago | Pro 249 $/mes | Desde 60 $/mes | No hace falta |
| Incluido en ese nivel | 50.000 puntuaciones, 5 GB, 249 $ crédito | 1,5 GB de ingesta | No aplicable |
| 50.000 puntuaciones al mes | Cubierto por Pro a 249 $ | Depende de los GB, probablemente más de 1,5 | Solo gasto de API del modelo |
| Tarifa por exceso | 1,50 $ por 1.000 puntuaciones, 3 $/GB | 0,10 $ por MB | Ninguna |
| Techo de elegibilidad | Ninguno declarado | Pro con menos de 50 empleados | Ninguno |
Braintrust factura por puntuación y Weave por gigabyte ingerido. No son unidades comparables, así que estime ambas con su propia carga antes de considerar que 60 $ es más barato que 249 $.
⚠️Warning: Varias comparativas afirman que los 249 $ de crédito de Braintrust Pro son una promoción de 2026 que baja a 100 $ al mes tras el 1 de septiembre de 2026. Ese vencimiento no aparece en la página de precios de Braintrust, que solo recoge «6–12 months free for qualifying startups» como promoción. Calcule desde la página del proveedor y no desde un artículo comparativo, este incluido.
Autoalojamiento y residencia de datos
Promptfoo es la única de las tres donde el autoalojamiento es el modo por defecto y no una mejora empresarial. Al ser una CLI y una biblioteca, sus casos de prueba y las salidas del modelo nunca salen de su entorno salvo que elija deliberadamente un nivel alojado. Para un equipo bajo normas de residencia de datos, eso elimina la pregunta en lugar de responderla.
Braintrust ofrece despliegue on-premise o alojado, pero solo en Enterprise, lo que implica precio personalizado y conversación comercial. Es una opción de despliegue real y no una frase de marketing, pero no puede evaluarla en autoservicio.
El nivel Enterprise de Weave ofrece una opción de inquilino único con claves de cifrado gestionadas por el cliente, cumplimiento HIPAA y conectividad privada segura. Léalo con cuidado: inquilino único con claves propias es una instancia dedicada, que no es lo mismo que ejecutarse dentro de su propio perímetro. Si su requisito es estrictamente on-premise, confirme los detalles con Weights & Biases en lugar de suponer que la opción de inquilino único lo satisface.
Quién debería usar qué
La forma del equipo decide esto más que las listas de funciones. Cinco perfiles cubren a la mayoría de lectores.
- Desarrolladora en solitario con un MVP → Promptfoo. Sin cuenta, sin contador y sin nada que retirar si el proyecto cambia de rumbo.
- Equipo de producto que publica una función de LLM con revisión de PM y QA → Braintrust. Los usuarios ilimitados del nivel gratuito son lo concreto que hace viable la revisión multidisciplinar.
- Equipo que ya usa Weights & Biases → Weave, siempre que esté por debajo de 50 empleados para Pro. Por encima, presupueste Enterprise antes de comparar.
- Equipo de seguridad o de plataforma que prueba inyección de prompts → Promptfoo, cuyo enfoque de red teaming encaja con la tarea. Véase también herramientas de seguridad de prompts y pruebas de inyección.
- Equipo que evalúa entre varios proveedores de modelos → Promptfoo o Braintrust, y enrute las llamadas por una pasarela para que comparar proveedores sea un cambio de configuración; véase el mejor gateway de API para LLM.
Herramientas de evaluación en la UE, Japón y China
Los conjuntos de datos de evaluación suelen construirse a partir del tráfico de producción, lo que los convierte en algunos de los datos más sensibles de una pila de LLM. Eso transforma la elección entre alojado y local en una cuestión de cumplimiento en tres mercados importantes.
Errores comunes al elegir una herramienta de evaluación
- 1Comparar 60 $ con 249 $ sin comprobar la elegibilidad
Why it matters: Weave Pro está restringido a organizaciones de menos de 50 empleados. Por encima de esa plantilla la comparación real es Braintrust Pro frente a un presupuesto Enterprise personalizado de Weave, y la cifra de 60 $ no está disponible para usted. - 2Presupuestar en torno a un vencimiento promocional de Braintrust que no está publicado
Why it matters: La afirmación de que el crédito de Pro baja a 100 $ al mes tras el 1 de septiembre de 2026 no aparece en la página de precios de Braintrust. Planificar una migración en torno a un vencimiento que el proveedor no ha anunciado desperdicia esfuerzo; vuelva a leer la página de precios. - 3Tratar puntuaciones y gigabytes como unidades comparables
Why it matters: Braintrust mide puntuaciones y Weave mide ingesta. Una carga que cabe holgadamente en 50.000 puntuaciones puede caber o no en 1,5 GB según lo grandes que sean sus trazas. Estime ambas con sus propios datos antes de ordenar por precio. - 4Adoptar una plataforma para un conjunto de quince casos
Why it matters: Por debajo de unos veinte casos de prueba, un script puntuado en CI hace el mismo trabajo sin cuenta, sin contador y sin límite de retención. Las plataformas se ganan su sitio cuando el cuello de botella es la gestión del conjunto de datos, no la puntuación. - 5Suponer que inquilino único significa on-premise
Why it matters: La opción Enterprise de inquilino único de Weave con claves gestionadas por el cliente es una instancia dedicada, no un despliegue dentro de su propio perímetro. Si su requisito es estrictamente on-premise, confírmelo con W&B en lugar de leer inquilino único como equivalente.
Sáltese esto si…
Si su conjunto de pruebas son una docena de prompts y los ejecuta una sola ingeniera, sáltese las tres y escriba un script puntuado en CI. Obtiene la misma señal de regresión sin cuenta, contador ni ventana de retención, y podrá pasar a una plataforma más adelante sin haber perdido nada, porque el activo es el conjunto de datos y se mueve con usted.
El umbral que merece la pena esperar llega cuando gestionar el conjunto de datos se convierte en el trabajo: cuando quiere llevar casos fallidos de producción al conjunto de pruebas de forma rutinaria, cuando alguien que no programa debe calificar salidas, o cuando necesita comparar los resultados de este mes con los del trimestre pasado. Esos son problemas de gestión de datos, y es lo que en realidad está comprando. La puntuación en sí siempre fue la parte fácil.
💡Tip: Un disparador práctico: adopte una plataforma la primera vez que se descubra montando una hoja de cálculo para seguir qué versión del prompt puntuó qué. Esa hoja es el producto que está a punto de comprar, y comprarlo sale más barato que mantenerlo.
Preguntas frecuentes
¿Cuál es la mejor herramienta de evaluación de LLM en 2026?
Braintrust para equipos donde personas no técnicas revisan resultados, gracias a los usuarios ilimitados incluso en el nivel gratuito. Weave si ya usa Weights & Biases y está por debajo de 50 empleados. Promptfoo si quiere evaluaciones como configuración versionada que se ejecuten gratis en su propia infraestructura. Las tres cubren LLM como juez, evaluadores propios y pruebas de regresión.
¿OpenAI adquirió Promptfoo?
Sí. OpenAI anunció la adquisición el 9 de marzo de 2026 y declaró que Promptfoo seguirá siendo de código abierto bajo su licencia actual y que los clientes existentes seguirán recibiendo servicio y soporte. A finales de agosto de 2026 el repositorio sigue bajo la organización promptfoo, sigue con licencia MIT y se mantiene activamente.
¿Cuánto cuesta Braintrust?
El nivel Starter gratuito incluye 10.000 puntuaciones al mes, 1 GB de datos procesados, 14 días de retención, 10 $ de crédito de modelo y usuarios ilimitados. Pro cuesta 249 $ al mes e incluye 249 $ de crédito, 50.000 puntuaciones, 5 GB y 30 días de retención, con exceso a 1,50 $ por 1.000 puntuaciones. Enterprise tiene precio personalizado y añade despliegue on-premise o alojado.
¿Weave es gratis y cuáles son los límites?
Weave tiene un nivel gratuito con plazas ilimitadas y 1 GB al mes de ingesta de datos. Pro parte de 60 $ al mes con 1,5 GB, pero Weights & Biases lo restringe a equipos en fase inicial con menos de 50 empleados; las organizaciones mayores deben pasar a Enterprise. La ingesta adicional cuesta 0,10 $ por MB.
¿Promptfoo es realmente gratis a cualquier escala?
Sí, en el sentido de que la herramienta tiene licencia MIT y se ejecuta en sus propias máquinas, así que no hay cargo por puntuación ni por gigabyte. Sigue pagando las llamadas de API del modelo que hacen las evaluaciones, pero ese coste existe en cualquier plataforma y no es específico de Promptfoo. Además existe un nivel Enterprise alojado opcional.
¿Cuál puedo autoalojar?
Promptfoo por defecto, ya que es una CLI y biblioteca que se ejecuta donde usted la ejecute. Braintrust ofrece despliegue on-premise o alojado en su plan Enterprise. Weave ofrece una opción Enterprise de inquilino único con claves gestionadas por el cliente, que es una instancia dedicada más que un verdadero on-premise, así que confirme los detalles si tiene un requisito estricto.
¿Alguna tiene programa de afiliados?
No encontramos programa público de afiliados o referidos para creadores en Braintrust, Weights & Biases ni Promptfoo. Weights & Biases tiene un programa de partners, pero su página pública describe asociaciones de reventa e integración tecnológica dirigidas a consultoras, no un pago por referido. Tenga en cuenta además que usebraintrust.com es un marketplace de talento independiente, sin relación con braintrust.dev. PromptQuorum no gana nada con esta página.
¿Qué diferencia hay entre evaluación y monitorización?
La evaluación ejecuta un conjunto fijo de datos antes de publicar y le dice si un cambio mejoró o degradó la calidad. La monitorización observa el tráfico real tras la publicación y le dice qué está haciendo el sistema ahora. Esta página cubre lo primero. Son complementarias y muchos equipos hacen ambas, pero las herramientas y las preguntas son distintas.
Veredicto final
- Use Braintrust si personas que no escriben código deben revisar los resultados — siguiente paso: empiece por el nivel gratuito, que permite usuarios ilimitados, y compruebe si sus PM realmente lo abren antes de pagar Pro.
- Use Weave si Weights & Biases ya es su sistema de registro — siguiente paso: confirme que está por debajo del techo de 50 empleados antes de contar con el nivel de 60 $, y presupueste Enterprise si no lo está.
- Use Promptfoo si quiere evaluaciones como configuración revisable sin contador de proveedor — siguiente paso: escriba su primer conjunto de datos en YAML y ejecútelo en CI antes de evaluar nada alojado.
- Use Promptfoo en concreto si está probando inyección de prompts y seguridad de agentes y no solo calidad de salida — siguiente paso: empiece por sus funciones de red teaming, que es donde OpenAI dirige la inversión.
- Sáltese las tres si tiene una docena de casos de prueba y una sola ingeniera — siguiente paso: escriba un script puntuado en CI y vuelva a plantearlo cuando gestionar el conjunto de datos sea el cuello de botella.