Skip to main content
PromptQuorum
Home/Local LLMs/2026년 최고의 LLM 평가 도구: Braintrust, Weave, Promptfoo
Tools & Interfaces

2026년 최고의 LLM 평가 도구: Braintrust, Weave, Promptfoo

·읽는 데 13분·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

이 페이지에는 타사 제품에 대한 참조 링크가 포함되어 있습니다. PromptQuorum은 어떤 제휴 프로그램에도 등록되어 있지 않습니다 — 이는 수수료가 발생하지 않는 일반 링크입니다. 링크 클릭 및 이후 단계는 전적으로 귀하의 책임입니다. 이 링크는 PromptQuorum의 어떠한 보증이나 검증을 나타내지 않습니다.

LLM 기능을 프로덕션에 올리는 팀에게 가장 종합적인 평가 플랫폼은 Braintrust로, 월 1만 건 채점까지 무료이고 Pro는 249달러입니다. 이미 Weights & Biases를 쓰고 있다면 Weave가 자연스러운 선택이며 월 60달러부터지만, 직원 50명 미만 조직으로 제한됩니다. Promptfoo는 최고의 무료·CI 네이티브 선택지입니다. MIT 라이선스이고 자체 장비에서 돌기 때문에 어떤 규모에서도 무료이며, 2026년 3월부터 OpenAI 소유가 되었고 OpenAI는 현재 라이선스 그대로 오픈소스를 유지하겠다고 공개적으로 약속했습니다.

Key Takeaways

  • Braintrust — 무료 Starter 등급은 월 1만 건 채점, 처리 데이터 1GB, 14일 보존, 10달러 모델 크레딧, 무제한 사용자를 제공합니다. Pro는 월 249달러이며 249달러 모델 크레딧, 5GB 데이터, 5만 건 채점, 30일 보존을 포함합니다. Enterprise는 맞춤 보존과 온프레미스 또는 호스팅 배포를 더합니다.
  • Weave — Weights & Biases의 일부입니다. 무료 등급은 Weave 좌석 무제한과 월 1GB 수집을 제공합니다. Pro는 1.5GB로 월 60달러부터지만, 자격이 "early-stage teams fewer than 50 employees"로 명시적으로 제한되며 더 큰 조직은 Enterprise로 옮겨야 합니다. 추가 수집은 MB당 0.10달러입니다.
  • Promptfoo — GitHub 별 2.46만, MIT 라이선스이며, 이미 보유한 인프라에서 CLI와 라이브러리로 실행되므로 어떤 규모에서도 무료입니다. 유일한 비용은 평가 자체가 소비하는 모델 API 지출이며, 이는 어떤 플랫폼에서든 LLM 심판 방식이라면 발생합니다.
  • OpenAI는 2026년 3월 9일 Promptfoo 인수를 발표하고 공개적으로 밝혔습니다. "Promptfoo will remain open source under the current license, and we will continue to service and support current customers." 저장소는 여전히 MIT 라이선스이며 이 페이지를 확인한 당일에도 갱신되었습니다.
  • 바로잡을 대목이 있습니다. 여러 글이 Braintrust Pro의 모델 크레딧을 2026년 9월 1일 이후 월 100달러로 내려가는 프로모션 가격으로 설명합니다. 그러나 Braintrust 가격 페이지에는 그런 종료일이 없습니다. 페이지에 실린 유일한 프로모션은 "6–12 months free for qualifying startups"입니다. 예산은 공급업체 페이지를 기준으로 잡으세요.
  • Promptfoo는 평가 도구인 동시에 보안 도구입니다. 자체 설명이 레드팀, 침투 테스트, 취약점 스캐닝으로 시작하며, OpenAI도 인수를 에이전트 보안 테스트라는 맥락에서 설명했습니다. 이는 Braintrust나 Weave와의 실질적인 무게중심 차이입니다.
  • 셋 다 창작자를 위한 공개 제휴나 추천 프로그램이 없습니다. Weights & Biases는 파트너 프로그램을 운영하지만, 이는 컨설팅 회사를 대상으로 한 리셀러·기술 통합 체계이지 추천당 지급이 아닙니다. PromptQuorum은 이 페이지에서 수익을 얻지 않습니다.

🏆 상황별 최적 선택

채점 기능 목록이 아니라 평가가 어디서 실행되고 누가 결과를 읽는지로 고르세요. 셋 다 같은 채점 기본기를 갖췄습니다. 아래를 읽어 내려가다 본인에게 해당하는 첫 줄에서 멈추세요.

  • 코드를 쓰지 않는 사람이 실패 사례를 검토해야 한다 → Braintrust. 호스팅 화면, 사람 검토 큐, 데이터셋 버전 관리가 바로 그것을 위해 존재하며, 무료 등급이 초기 단계 사용량 대부분을 감당합니다.
  • 이미 Weights & Biases를 쓰고 있다 → Weave. 평가가 기존 실험 추적 옆에 놓이고 무료 등급은 좌석이 무제한입니다. Pro를 전제하기 전에 직원 50명 제한을 확인하세요.
  • 벤더 없이 버전 관리되는 설정으로 평가를 두고 싶다 → Promptfoo. 코드 옆의 YAML이나 JS로, 풀 리퀘스트에서 차이를 볼 수 있고 규모와 무관하게 무료입니다.
  • 품질만이 아니라 프롬프트 인젝션과 에이전트 보안을 테스트한다 → Promptfoo. 레드팀과 취약점 스캐닝이 표방하는 목적입니다. 프롬프트 보안과 인젝션 테스트 도구도 참고하세요.
  • 테스트 케이스가 몇 개뿐이고 엔지니어도 한 명이다 → 아직 아무것도 필요 없습니다. 데이터셋이 관리가 필요할 만큼 커지기 전까지는 CI에서 점수를 매기는 스크립트로 충분합니다.
Braintrust — 가격 보기제품 링크 · 공개됨Promptfoo — 오픈소스 저장소제품 링크 · 공개됨

평가 도구가 실제로 하는 일

LLM 평가 도구는 테스트 케이스 데이터셋을 프롬프트나 에이전트에 통과시키고 각 출력에 점수를 매겨, 변경이 사용자에게 닿기 전에 좋아졌는지 나빠졌는지 알 수 있게 합니다. 데이터셋은 보통 입력과 기대 출력의 쌍이며, 프로덕션 로그에서 뽑거나 경계 사례로 직접 쓰거나 생성한 것입니다. 채점기는 문자열 일치나 JSON 스키마 검증 같은 결정적 검사부터, 두 번째 모델이 기준표에 따라 채점하는 LLM 심판, 직접 작성하는 사용자 정의 함수까지 다양합니다.

이는 시스템이 가동된 뒤 무엇을 하는지 지켜보는 것과는 다른 일입니다. 평가는 "이 변경을 내보내도 안전한가"에 답하고, 프로덕션 모니터링은 "지금 무엇을 하고 있나"에 답합니다. 이 페이지는 앞의 질문을 다룹니다. 같은 문제를 프롬프트 수준에서 보려면 프롬프트 품질 평가 방법을 참고하세요.

LLM 평가 도구는 고정된 테스트 케이스 데이터셋을 프롬프트나 에이전트에 통과시키고, 결정적 검사·LLM 심판 채점·사용자 정의 함수로 각 출력에 점수를 매겨, 출시 전에 변경이 품질을 개선했는지 떨어뜨렸는지 보고합니다.

같은 답을 두 번 내놓지 않는 대상을 위한 테스트 스위트입니다. 정확한 출력을 단언하는 대신 점수를 매기고, 프롬프트를 바꿨을 때 평균이 잘못된 방향으로 움직이는지 지켜봅니다.

Braintrust, Weave, Promptfoo 비교

셋 다 LLM 심판, 사용자 정의 채점기, 데이터셋 기반 회귀 테스트를 지원하므로 비교의 축은 호스팅 방식, 비용 구조, 자격 요건입니다. 가격은 2026년 8월 28일 각 업체 페이지에서, 저장소 수치는 같은 날 GitHub API에서 읽었습니다.

평가 항목BraintrustWeavePromptfoo
형태화면이 있는 호스팅 플랫폼호스팅형, W&B의 일부직접 실행하는 CLI와 라이브러리
라이선스상용SDK는 Apache-2.0, 서비스는 호스팅형MIT
무료 등급월 1만 건 채점, 1GB, 14일월 1GB 수집, 좌석 무제한어떤 규모에서도 무료
유료 진입Pro 월 249달러, 249달러 크레딧월 60달러부터, 1.5GBEnterprise 등급, 맞춤 견적
자격 상한명시 없음Pro는 직원 50명 미만만없음
초과 요금Pro에서 1,000건당 1.50달러수집 MB당 0.10달러본인의 모델 API 지출만
자체 호스팅Enterprise, 온프레미스 또는 호스팅Enterprise, 단일 테넌트기본값 — 본인 장비에서 실행
제휴 프로그램찾지 못함찾지 못함찾지 못함

⚠️Warning: Weave의 Pro는 단순히 더 싼 요금제가 아닙니다. Weights & Biases는 이를 "for early-stage teams fewer than 50 employees"라고 명시하며, 이 기준을 넘는 고객은 Enterprise로 전환해야 한다고 밝힙니다. 인원이 그 선을 넘는다면 실제 비교 대상은 Braintrust Pro의 249달러 대 맞춤 Enterprise 견적이지, 60달러가 아닙니다.

Braintrust: 프로덕션 선택지

코드를 쓰지 않는 사람이 평가 결과를 봐야 할 때 고르는 것이 Braintrust입니다. 그 가치는 호스팅 화면, 데이터셋 버전 관리, 사람 검토 흐름에 집중되어 있는데, 이는 그러지 않으면 직접 만들어야 하는 부분입니다.

1

Braintrust — 교차 기능 프로덕션 팀에 최적

월 1만 건 채점까지 무료, Pro 249달러에 249달러 크레딧 포함

무료 Starter 등급은 호스팅 플랫폼치고 이례적으로 넉넉합니다. 월 1만 건 채점, 처리 데이터 1GB, 14일 보존, 10달러 모델 크레딧에 더해 사용자·프로젝트·데이터셋·실험이 모두 무제한입니다. 무료 등급의 무제한 좌석이 여기서 중요한 이유는, Braintrust를 고르는 이유 자체가 프로덕트 매니저와 도메인 전문가에게 라이선스를 사주지 않고도 실패 사례를 검토하게 하는 데 있기 때문입니다. 월 249달러의 Pro는 이를 5만 건 채점, 5GB, 30일 보존으로 올리고 249달러 모델 크레딧을 포함해, 중간 규모 작업에서는 심판 모델 지출을 사실상 상쇄합니다. 초과는 차단이 아니라 과금입니다. Pro에서 1,000건당 1.50달러, GB당 3달러입니다. Enterprise는 맞춤 보존과 내보내기, RBAC, 온프레미스 또는 호스팅 배포를 더합니다.

장점

  • +무료 등급에서도 사용자 수 무제한이며, 이것이 바로 선택의 요점
  • +월 1만 건 채점 무료 등급이 초기 프로젝트를 실제로 감당
  • +Pro에 249달러 모델 크레딧이 포함되어 심판 모델 지출을 크게 상쇄
  • +프라이버시가 민감한 작업을 위한 온프레미스 또는 호스팅 배포 제공

단점

  • 무료 등급의 14일 보존은 지난달과 비교하려면 짧음
  • 자체 호스팅에는 Enterprise와 영업 상담이 필요하고 가격이 공개되지 않음
  • 상용 플랫폼이라 Promptfoo와 달리 가격이 바뀌어도 대안이 없음
Braintrust — 가격 보기제품 링크 · 공개됨

Weave: Weights & Biases 선택지

팀이 이미 Weights & Biases에서 실험을 추적하고 있다면 Weave가 당연한 답이고, 그렇지 않다면 설득하기 더 어렵습니다. 논거는 통합 그 자체입니다. 평가가 이미 보고 있는 실행 기록 옆에 놓입니다.

1

Weave — Weights & Biases 생태계 안에서 최적

월 1GB 무료에 좌석 무제한, Pro는 직원 50명 미만일 때 월 60달러부터

Weave는 애플리케이션 평가, 추적, 채점기를 다루며, 무료 등급은 Weave 좌석 무제한과 월 1GB 수집을 제공해 소규모 팀에는 합리적인 출발점입니다. Pro는 월 단위 청구로 월 60달러부터 1.5GB를 제공하고, 추가 수집은 MB당 0.10달러입니다. 걸림돌은 가격보다 자격입니다. Weights & Biases는 Pro가 "for early-stage teams fewer than 50 employees" 대상이며, 이 기준을 넘는 고객은 Enterprise로 옮겨야 한다고 밝힙니다. 진지한 배포 옵션은 Enterprise에 있으며 단일 테넌트, HIPAA 준수, 고객 관리 암호화 키, SSO, 감사 로그가 포함됩니다. 다만 단일 테넌트는 진짜 온프레미스라기보다 전용 인스턴스에 가까우므로, 온프레미스 전용 요건을 충족한다고 단정하기 전에 W&B에 세부를 확인하세요.

장점

  • +무료 등급에 Weave 좌석 무제한과 월 1GB 수집
  • +평가가 기존 W&B 실험 추적 및 레지스트리와 나란히 놓임
  • +Enterprise가 단일 테넌트, HIPAA, 고객 관리 키, SSO를 제공
  • +월 60달러로 셋 중 가장 낮은 유료 진입가

단점

  • Pro가 직원 50명 미만 조직으로 제한되며 이는 단단한 상한
  • MB당 0.10달러의 수집 과금은 채점 건수보다 예측이 어려움
  • 이미 Weights & Biases를 쓰지 않는다면 단독 논거가 가장 약함

Promptfoo: 무료·CI 네이티브 선택지

Promptfoo는 어떤 규모에서도 비용이 들지 않는 쪽이며, 이유는 직접 실행하기 때문입니다. 플랫폼이 아니라 CLI와 라이브러리이므로, 평가는 코드 옆에 설정으로 놓이고 테스트가 이미 돌고 있는 곳에서 실행됩니다.

1

Promptfoo — 최고의 무료·CI 네이티브 선택지

별 2.46만, MIT 라이선스, 어떤 규모에서도 무료, 현재 OpenAI 소유

Promptfoo는 GitHub 별 24,638개에 MIT 라이선스이며, 이 페이지를 확인한 당일에도 갱신되어 활동성이 분명합니다. 이미 보유한 인프라에서 돌기 때문에 채점당·기가바이트당 계량이 없습니다. 유일한 비용은 평가가 소비하는 모델 API 호출이며, 이는 어느 플랫폼에서든 지불할 몫입니다. 데이터셋을 YAML, CSV, JS로 정의하는 것은 화면을 클릭하는 것보다 번거롭지만, 평가를 풀 리퀘스트에서 비교할 수 있게 해줍니다. 평가 설정을 다른 코드처럼 리뷰해야 한다면 이는 실질적인 이점입니다. 실체를 알아둘 가치가 있습니다. 프로젝트는 스스로를 프롬프트·에이전트·RAG 테스트로 소개하며, AI를 위한 레드팀, 침투 테스트, 취약점 스캐닝을 함께 내겁니다. 여기서 보안은 부수 기능이 아니며, OpenAI도 인수를 에이전트 보안 테스트의 맥락에서 설명했습니다.

장점

  • +어떤 규모에서도 무료이며 채점이나 수집 계량이 없음
  • +평가가 버전 관리되는 설정이 되어 풀 리퀘스트에서 비교·리뷰 가능
  • +MIT 라이선스라 조건이 바뀌어도 의존할 벤더가 없음
  • +레드팀과 취약점 스캐닝이 나중에 붙인 것이 아니라 일급 기능

단점

  • 기본적으로 호스팅 화면이 없어 코드를 쓰지 않는 사람이 클릭할 곳이 없음
  • YAML·CSV 데이터셋은 브라우저에서 만드는 것보다 준비 부담이 큼
  • 이제 OpenAI 소유라, 오픈소스 약속이 있어도 거버넌스 측면의 고려사항이 남음
Promptfoo — 오픈소스 저장소제품 링크 · 공개됨

OpenAI 인수가 Promptfoo에 의미하는 것

OpenAI는 2026년 3월 9일 Promptfoo 인수를 발표하며 오픈소스 유지를 공개적으로 약속했습니다. OpenAI 자신의 표현은 이렇습니다. "Promptfoo will remain open source under the current license, and we will continue to service and support current customers." 인수는 당시 TechCrunch, CNBC, Forbes가 보도했고 OpenAI와 Promptfoo 각자의 사이트에서도 확인됩니다.

현장의 정황은 지금까지 그 약속을 뒷받침합니다. 거의 여섯 달이 지난 지금도 저장소는 `promptfoo` 조직 아래에 있고, 여전히 MIT 라이선스이며, 이 페이지를 확인한 당일에도 갱신되었습니다. 보고 싶은 그림입니다.

그럼에도 생각해볼 이유는 라이선스가 아니라 거버넌스입니다. 평가 도구는 모델을 판단하는 데 쓰는 물건인데, 이제 모델을 만드는 회사의 소유가 되었습니다. MIT 라이선스는 프로젝트 방향이 언젠가 자신에게 맞지 않게 되면 포크할 수 있다는 뜻이며, 이는 Braintrust나 Weave가 제공하지 않는 실질적 보호입니다. 다만 평가 전략이 모델 벤더 간 중립성에 기대고 있다면, 그것은 가정이 아니라 의식적인 결정이어야 합니다.

📌Note: OpenAI는 Promptfoo의 기술을 자동 레드팀과 에이전트 보안 테스트를 위해 OpenAI Frontier에 통합하겠다고 밝혔습니다. 이는 Promptfoo가 원래 갖고 있던 보안 중심과 일치하며, 범용 평가보다 보안 쪽에 더 많은 투자가 갈 가능성을 시사합니다.

가격 비교

비용은 좌석이 아니라 데이터 양과 심판 모델 지출에 따라 늘어납니다. 그래서 무료 등급의 무제한 사용자가 처음 보이는 것보다 훨씬 유용합니다. 아래 표는 월 약 5만 건 평가 채점이라는 중간 규모 작업을 기준으로 계산했습니다.

시나리오BraintrustWeavePromptfoo
무료 등급 한도1만 건 채점, 1GB, 14일월 1GB 수집, 좌석 무제한한도 없음
유료 등급Pro 월 249달러월 60달러부터필요 없음
해당 등급 포함 사항5만 건 채점, 5GB, 249달러 크레딧1.5GB 수집해당 없음
월 5만 건 채점249달러 Pro로 커버GB에 따라 다르며 1.5GB 초과 가능성모델 API 지출만
초과 요율1,000건당 1.50달러, GB당 3달러MB당 0.10달러없음
자격 상한명시 없음Pro는 직원 50명 미만없음

Braintrust는 채점 단위로, Weave는 수집 기가바이트 단위로 과금합니다. 비교 가능한 단위가 아니므로, 60달러가 249달러보다 싸다고 보기 전에 자신의 작업량으로 둘 다 추정하세요.

⚠️Warning: 여러 비교 글이 Braintrust Pro의 249달러 크레딧을 2026년 프로모션이며 2026년 9월 1일 이후 월 100달러로 내려간다고 서술합니다. 그 종료일은 Braintrust 가격 페이지에 없으며, 페이지가 프로모션으로 싣는 것은 "6–12 months free for qualifying startups"뿐입니다. 비교 기사가 아니라 공급업체 페이지를 기준으로 계산하세요. 이 글도 예외가 아닙니다.

자체 호스팅과 데이터 소재지

셋 중 자체 호스팅이 기업용 업그레이드가 아니라 기본값인 것은 Promptfoo뿐입니다. CLI와 라이브러리이기 때문에, 호스팅 등급을 일부러 고르지 않는 한 테스트 케이스와 모델 출력은 결코 환경을 벗어나지 않습니다. 데이터 소재지 규정을 받는 팀에게 이는 질문에 답하는 것이 아니라 질문 자체를 없앱니다.

Braintrust는 온프레미스 또는 호스팅 배포를 제공하지만 Enterprise에 한하며, 이는 맞춤 가격과 영업 상담을 뜻합니다. 마케팅 문구가 아니라 실제 배포 옵션이지만, 셀프서비스로 평가할 수는 없습니다.

Weave의 Enterprise 등급은 고객 관리 암호화 키, HIPAA 준수, 안전한 사설 연결을 갖춘 단일 테넌트 옵션을 제공합니다. 이 대목은 꼼꼼히 읽으세요. 고객 관리 키를 쓰는 단일 테넌트는 전용 인스턴스이며, 자사 경계 안에서 실행하는 것과 같지 않습니다. 요구사항이 엄격히 온프레미스라면, 단일 테넌트가 이를 충족한다고 단정하지 말고 Weights & Biases에 세부를 확인하세요.

누가 무엇을 써야 하나

기능 목록보다 팀의 형태가 이를 결정합니다. 다섯 가지 유형이 대부분의 독자를 포괄합니다.

  • MVP를 만드는 1인 개발자 → Promptfoo. 계정도 계량기도 없고, 프로젝트 방향이 바뀌어도 치울 것이 없습니다.
  • PM과 QA 검토를 거쳐 LLM 기능을 출시하는 제품 팀 → Braintrust. 무료 등급의 무제한 사용자가 교차 기능 검토를 가능하게 만드는 바로 그 조건입니다.
  • 이미 Weights & Biases를 쓰는 팀 → Weave, 단 Pro는 직원 50명 미만이어야 합니다. 그 이상이면 비교 전에 Enterprise를 견적받으세요.
  • 프롬프트 인젝션을 테스트하는 보안 또는 플랫폼 팀 → Promptfoo. 레드팀 중심이 과업과 맞습니다. 프롬프트 보안과 인젝션 테스트 도구도 참고하세요.
  • 여러 모델 제공자에 걸쳐 평가하는 팀 → Promptfoo 또는 Braintrust. 호출을 게이트웨이로 라우팅해 제공자 비교가 설정 변경이 되게 하세요. 최고의 LLM API 게이트웨이를 참고하세요.

EU·일본·중국에서의 평가 도구

평가 데이터셋은 대개 프로덕션 트래픽으로 만들어지므로, LLM 스택에서 가장 민감한 데이터에 속합니다. 그래서 호스팅형이냐 로컬이냐의 선택이 세 주요 시장에서 컴플라이언스 문제가 됩니다.

평가 도구를 고를 때 흔한 실수

  1. 1
    자격을 확인하지 않고 60달러와 249달러를 비교하는 것
    Why it matters: Weave Pro는 직원 50명 미만 조직으로 제한됩니다. 그 인원을 넘으면 실제 비교는 Braintrust Pro 대 맞춤 Weave Enterprise 견적이며, 60달러라는 숫자는 애초에 쓸 수 없습니다.
  2. 2
    공개되지 않은 Braintrust 프로모션 종료일을 기준으로 예산을 잡는 것
    Why it matters: Pro 크레딧이 2026년 9월 1일 이후 월 100달러로 내려간다는 주장은 Braintrust 가격 페이지에 없습니다. 공급업체가 발표하지도 않은 종료일에 맞춰 마이그레이션을 계획하는 것은 노력 낭비입니다. 가격 페이지를 다시 읽으세요.
  3. 3
    채점 건수와 기가바이트를 비교 가능한 단위로 취급하는 것
    Why it matters: Braintrust는 채점을, Weave는 수집량을 잽니다. 5만 건 채점 안에 여유롭게 들어가는 작업이 1.5GB 안에 들어갈지는 트레이스 크기에 따라 다릅니다. 가격으로 순위를 매기기 전에 자신의 데이터로 둘 다 추정하세요.
  4. 4
    열다섯 개짜리 데이터셋을 위해 플랫폼을 도입하는 것
    Why it matters: 테스트 케이스가 대략 스무 개 아래라면 CI에서 점수를 매기는 스크립트가 계정도 계량기도 보존 한도도 없이 같은 일을 합니다. 플랫폼이 값을 하는 시점은 채점이 아니라 데이터셋 관리가 병목이 되었을 때입니다.
  5. 5
    단일 테넌트를 온프레미스로 여기는 것
    Why it matters: 고객 관리 키를 쓰는 Weave의 Enterprise 단일 테넌트 옵션은 전용 인스턴스이지 자사 경계 안의 배포가 아닙니다. 요구사항이 엄격히 온프레미스라면 단일 테넌트를 동등하게 읽지 말고 W&B에 확인하세요.

이런 경우엔 건너뛰세요

테스트 세트가 프롬프트 열두 개이고 엔지니어 한 명이 돌린다면, 셋 다 건너뛰고 CI에서 점수를 매기는 스크립트를 쓰세요. 계정도 계량기도 보존 기간도 없이 같은 회귀 신호를 얻고, 나중에 플랫폼으로 옮겨도 잃을 것이 없습니다. 자산은 데이터셋이고 그것은 함께 옮겨가기 때문입니다.

기다릴 만한 기준선은 데이터셋 관리가 일 자체가 되는 시점입니다. 실패한 사례를 프로덕션에서 테스트 세트로 정기적으로 끌어오고 싶을 때, 코드를 쓰지 않는 사람이 출력에 등급을 매겨야 할 때, 또는 이번 달 결과를 지난 분기와 비교해야 할 때입니다. 이는 데이터 관리 문제이고, 여러분이 실제로 사는 것이 바로 그것입니다. 채점 자체는 예나 지금이나 쉬운 쪽이었습니다.

💡Tip: 실용적인 신호가 있습니다. 어떤 프롬프트 버전이 몇 점을 받았는지 추적하려고 스프레드시트를 만들고 있는 자신을 발견한 그때가 플랫폼을 도입할 시점입니다. 그 스프레드시트가 바로 여러분이 사려는 제품이고, 사는 편이 직접 유지하는 것보다 쌉니다.

자주 묻는 질문

2026년 최고의 LLM 평가 도구는 무엇인가요?

비개발자가 결과를 검토하는 팀에는 Braintrust입니다. 무료 등급에서도 사용자가 무제한이기 때문입니다. 이미 Weights & Biases를 쓰고 직원이 50명 미만이라면 Weave. 자체 인프라에서 무료로 돌아가는 버전 관리된 설정으로 평가를 두고 싶다면 Promptfoo입니다. 셋 다 LLM 심판, 사용자 정의 채점기, 회귀 테스트를 지원합니다.

OpenAI가 Promptfoo를 인수했나요?

네. OpenAI는 2026년 3월 9일 인수를 발표하며 Promptfoo가 현재 라이선스 그대로 오픈소스를 유지하고 기존 고객도 계속 서비스와 지원을 받는다고 밝혔습니다. 2026년 8월 말 기준 저장소는 여전히 promptfoo 조직 아래에 있고 MIT 라이선스이며 활발히 유지보수되고 있습니다.

Braintrust는 얼마인가요?

무료 Starter 등급은 월 1만 건 채점, 처리 데이터 1GB, 14일 보존, 10달러 모델 크레딧, 무제한 사용자를 포함합니다. Pro는 월 249달러로 249달러 크레딧, 5만 건 채점, 5GB, 30일 보존을 포함하며 초과는 1,000건당 1.50달러입니다. Enterprise는 맞춤 견적이며 온프레미스 또는 호스팅 배포를 더합니다.

Weave는 무료인가요, 한도는 어떻게 되나요?

Weave에는 좌석 무제한과 월 1GB 데이터 수집을 제공하는 무료 등급이 있습니다. Pro는 1.5GB로 월 60달러부터이지만, Weights & Biases가 직원 50명 미만의 초기 단계 팀으로 제한하며 더 큰 조직은 Enterprise로 옮겨야 합니다. 추가 수집은 MB당 0.10달러입니다.

Promptfoo는 정말 어떤 규모에서도 무료인가요?

네. 도구 자체가 MIT 라이선스이고 자체 장비에서 돌기 때문에 채점당·기가바이트당 요금이 없다는 의미에서 그렇습니다. 평가가 만드는 모델 API 호출 비용은 여전히 부담하지만, 그 비용은 어느 플랫폼에서나 존재하며 Promptfoo에 국한된 것이 아닙니다. 그 위에 선택 사항인 호스팅 Enterprise 등급이 있습니다.

어느 것을 자체 호스팅할 수 있나요?

기본적으로 Promptfoo입니다. CLI와 라이브러리라 실행하는 곳에서 돌아갑니다. Braintrust는 Enterprise 요금제에서 온프레미스 또는 호스팅 배포를 제공합니다. Weave는 고객 관리 키를 쓰는 Enterprise 단일 테넌트 옵션을 제공하는데, 이는 진짜 온프레미스라기보다 전용 인스턴스이므로 엄격한 요건이 있다면 세부를 확인하세요.

이 중 제휴 프로그램이 있는 곳이 있나요?

Braintrust, Weights & Biases, Promptfoo 어디에서도 창작자 대상 공개 제휴나 추천 프로그램을 찾지 못했습니다. Weights & Biases는 파트너 프로그램을 운영하지만, 공개 페이지는 컨설팅 회사를 대상으로 한 리셀러·기술 통합 파트너십을 설명하며 추천당 지급이 아닙니다. 또한 usebraintrust.com은 braintrust.dev와 무관한 별개의 인재 마켓플레이스입니다. PromptQuorum은 이 페이지에서 수익을 얻지 않습니다.

평가와 모니터링의 차이는 무엇인가요?

평가는 출시 전에 고정된 데이터셋을 돌려 변경이 품질을 개선했는지 떨어뜨렸는지 알려줍니다. 모니터링은 출시 후 실제 트래픽을 지켜보며 시스템이 지금 무엇을 하는지 알려줍니다. 이 페이지는 앞의 것을 다룹니다. 둘은 상호 보완적이며 많은 팀이 둘 다 하지만, 도구도 던지는 질문도 다릅니다.

최종 결론

  • Braintrust를 쓰세요: 코드를 쓰지 않는 사람이 결과를 검토해야 한다면. 다음 단계는 사용자 무제한인 무료 등급으로 시작해, Pro 비용을 내기 전에 PM들이 실제로 열어보는지 확인하는 것입니다.
  • Weave를 쓰세요: Weights & Biases가 이미 기록 시스템이라면. 다음 단계는 60달러 등급을 전제하기 전에 직원 50명 상한 안에 있는지 확인하고, 아니라면 Enterprise를 견적받는 것입니다.
  • Promptfoo를 쓰세요: 벤더 계량기 없이 리뷰 가능한 설정으로 평가를 두고 싶다면. 다음 단계는 첫 데이터셋을 YAML로 작성해 CI에서 돌려본 뒤 호스팅 제품을 검토하는 것입니다.
  • 특히 Promptfoo를 쓰세요: 출력 품질만이 아니라 프롬프트 인젝션과 에이전트 보안을 테스트한다면. 다음 단계는 OpenAI가 투자를 향하고 있는 레드팀 기능부터 시작하는 것입니다.
  • 셋 다 건너뛰세요: 테스트 케이스가 열두 개이고 엔지니어도 한 명이라면. 다음 단계는 CI에서 점수를 매기는 스크립트를 쓰고, 데이터셋 관리가 병목이 되면 다시 검토하는 것입니다.

출처

A Note on Third-Party Facts

This article references third-party AI models, benchmarks, prices, and licenses. The AI landscape changes rapidly. Benchmark scores, license terms, model names, and API prices can shift between the time of writing and the time you read this. Before making deployment or compliance decisions based on this article, verify current figures on each provider’s official source: Hugging Face model cards for licenses and benchmarks, provider websites for API pricing, and EUR-Lex for current GDPR and EU AI Act text.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs