Skip to main content
PromptQuorum

llama-bench: 로컬 LLM 속도를 벤치마킹하는 가장 좋은 도구

llama-bench: 로컬 LLM 속도를 벤치마킹하는 가장 좋은 도구

이 페이지에는 타사 제품에 대한 참조 링크가 포함되어 있습니다. PromptQuorum은 어떤 제휴 프로그램에도 등록되어 있지 않습니다 — 이는 수수료가 발생하지 않는 일반 링크입니다. 링크 클릭 및 이후 단계는 전적으로 귀하의 책임입니다. 이 링크는 PromptQuorum의 어떠한 보증이나 검증을 나타내지 않습니다.

빠른 답변

llama.cpp에 포함된 llama-bench가 로컬 LLM의 속도를 벤치마킹하는 가장 좋은 도구입니다. 고정된 컨텍스트 길이와 양자화 수준에서 프롬프트 처리 속도와 생성 속도를 분리하여 보고합니다. 현재 설정을 빠르게 확인하려면 대신 Ollama의 `--verbose` 출력을 사용하세요.

  • 전반적으로 최고의 벤치마크: llama-bench — 프롬프트 처리 속도와 생성 속도를 분리하고 컨텍스트 길이와 양자화를 제어합니다.
  • 가장 빠른 확인: Ollama --verbose — 일반 채팅 응답에서 얻는 대략적인 초당 토큰 수치로, 별도의 벤치마크 도구가 필요 없습니다.
  • 최고의 GUI 옵션: LM Studio — 모델을 테스트하고 비교하는 동안 초당 토큰 수를 실시간으로 표시하며, 명령줄이 필요 없습니다.
  • 하드웨어 비교에 가장 적합: llama-bench — 이 중 유일하게 통제되고 재현 가능한 나란히 비교를 위해 만들어진 옵션입니다.
Tool Comparisons기초 이해

핵심 요점

  • llama-bench는 전반적으로 최고의 벤치마킹 도구로, 고정되고 재현 가능한 설정에서 프롬프트 처리 속도와 생성 속도를 분리합니다
  • Ollama의 --verbose 플래그는 "내 설정이 충분히 빠른가"를 확인하는 가장 빠른 방법이며, 통제된 하드웨어 비교를 대체하지는 않습니다
  • LM Studio는 명령줄 없이 빠른 테스트, 모델 실험, 실시간 성능 확인이 가능한 최고의 GUI 옵션입니다
  • 실행 간에는 모델, 양자화, 컨텍스트 길이를 동일하게 유지하세요. 서로 다른 설정을 비교하면 의미 없는 수치가 나옵니다
  • 여러 번 실행하여 결과를 평균화하고, 설정 정보가 없는 온라인상의 초당 토큰 수치는 절대 신뢰하지 마십시오

최선의 선택: llama-bench

llama-bench는 재현 가능하고 하드웨어 간 비교가 가능한 속도 수치가 필요한 모든 사람에게 적합한 기본 선택입니다. llama.cpp의 일부이며, 명령줄에서 실행되고, 각 테스트마다 두 가지 별도 수치를 보고합니다. 프롬프트 처리 속도(모델이 입력을 읽는 속도)와 생성 속도(새 토큰을 생성하는 속도)입니다. 이 두 수치는 부하 상태에서 매우 다르게 동작하므로, 이를 하나의 수치로 합치는 도구는 전체 그림의 절반을 가리는 셈입니다.

구매 전에 두 GPU를 비교하거나, 새 Mac이나 PC를 테스트하거나, 양자화 수준을 비교하거나, 결과를 공개적으로 게시하거나, 하드웨어 업그레이드가 그만한 가치가 있는지 판단할 때 llama-bench를 사용하세요. 각 테스트를 자동으로 반복하고 평균을 보고하므로 수동으로 다섯 번 실행할 필요가 없습니다.

가장 흔한 후속 질문은 컨텍스트 길이와 프롬프트/생성 길이 옵션이 실제로 무엇을 제어하는지입니다. 간단히 말해, llama-bench는 테스트 프롬프트의 길이와 생성할 토큰 수를 서로 독립적으로 고정할 수 있게 해주므로, 다른 설정을 전혀 바꾸지 않고도 짧은 채팅형 시나리오나 긴 문서형 시나리오를 테스트할 수 있습니다. 바로 이 분리가 두 결과를 애초에 비교 가능하게 만드는 요소입니다.

llama-bench는 상업용 제품이 아닙니다. GitHub의 llama.cpp 프로젝트의 무료 오픈소스 구성 요소이며, llama.cpp를 빌드하거나 설치하면 자동으로 포함됩니다.

빠른 확인: Ollama --verbose

Ollama의 `--verbose` 플래그는 현재 설정이 충분히 빠르게 느껴지는지 확인하는 가장 빠른 방법입니다. llama-bench를 대체하지는 않습니다. ollama run <model> --verbose를 실행하면 별도의 벤치마크 단계 없이 일반 채팅 응답 끝에 초당 토큰 수치가 출력됩니다.

이 수치는 반복적인 고정 컨텍스트 실행이 아니라 단일한 통제되지 않은 생성에서 나온 것이므로, 더 잡음이 많고 서로 다른 두 하드웨어를 비교하는 데는 적합하지 않습니다. "지금 이게 채팅에 쓸 만한가"를 답하는 데 사용하고, 다른 기기와 비교해도 통할 답이 필요할 때는 llama-bench를 사용하세요.

Ollama는 무료 오픈소스입니다. 설치 방법은 Ollama 공식 사이트를 참고하세요.

최고의 GUI 옵션: LM Studio

터미널을 건드리지 않고 초당 토큰 수를 실시간으로 확인하고 싶다면 LM Studio가 최선의 선택입니다. 채팅 인터페이스에서 생성 속도를 실시간으로 표시하므로, 빠른 하드웨어 확인, 모델 실험, 작업 중 양자화 비교에 편리합니다.

Ollama의 `--verbose` 플래그와 마찬가지로 LM Studio의 실시간 표시는 편리하지만 엄격하지는 않습니다. 하드웨어 구매 결정에서 llama-bench 결과를 신뢰할 수 있게 만드는 실행 횟수나 컨텍스트 길이 제어를 제공하지 않습니다. LM Studio는 무료 플랜을 제공하며, 다운로드는 LM Studio 공식 사이트에서 가능합니다.

구매 전 벤치마킹하기

대부분의 벤치마킹 검색 뒤에 있는 진짜 질문은 "어떤 도구를 써야 하나"가 아니라 "어떤 하드웨어를 사야 하나"입니다. 낯선 사람의 게시물에 있는 일반적인 초당 토큰 수치는 그 질문에 답하지 못합니다. 결정하기 전에 실제로 고려 중인 두 GPU에서 동일한 모델, 양자화, 컨텍스트 길이로 실행해 보세요.

자신의 llama-bench 실행에서 실제 수치를 얻었다면, 데스크톱을 계속 사용할 경우 로컬 LLM을 위한 최고의 GPU 가이드, 상시 가동되는 소형 기기를 원한다면 로컬 LLM을 위한 최고의 미니 PC 가이드, 개별 GPU 대신 통합 메모리를 원한다면 Apple Silicon과 NVIDIA GPU 비교 글의 옵션과 비교해 보세요.

유용한 벤치마크의 조건

유용한 비교는 실행 간에 모델, 양자화 수준, 컨텍스트 길이, 프롬프트 내용을 일정하게 유지하며, 프롬프트 처리 속도와 생성 속도를 별도로 보고합니다. 이러한 제어가 없으면 단일 초당 토큰 수치는 동일한 설정이 더 긴 프롬프트나 다른 양자화에서 어떻게 동작할지에 대해 거의 아무것도 알려주지 않습니다.

여러 번 실행하여 결과를 평균화하십시오. 단일 실행은 열 스로틀링, 백그라운드 프로세스, 모델의 콜드 스타트 로딩에 의해 왜곡됩니다. 모델, 양자화, 컨텍스트 길이가 함께 명시되지 않은 한, 포럼이나 소셜 미디어 게시물의 출처가 불명확한 초당 토큰 수치는 벤치마크가 아니라 대략적인 일화로 취급하십시오.

결론

진지하고 하드웨어 간 비교가 가능한 벤치마크에는 llama-bench를 사용하세요. 현재 설정을 빠르게 확인하려면 Ollama의 `--verbose` 출력을 사용하세요. 실시간 성능 확인이 가능한 가장 쉬운 GUI 경험을 원한다면 LM Studio를 사용하세요. 그리고 진짜 목적이 무엇을 살지 결정하는 것이라면, 결정하기 전에 관심 있는 정확한 모델과 양자화를 두 기기 모두에서 벤치마킹한 다음, 승자를 저희의 GPU, 미니 PC, Mac 가이드와 비교해 보세요.

자주 묻는 질문

llama-bench의 컨텍스트 크기 및 프롬프트/생성 옵션은 무엇을 제어합니까?
llama-bench는 실행에 사용되는 컨텍스트 길이와 독립적으로 테스트 프롬프트의 토큰 수와 생성할 토큰 수를 고정할 수 있게 해줍니다. 그래서 다른 설정을 바꾸지 않고도 짧은 컨텍스트 시나리오나 긴 컨텍스트 시나리오를 테스트할 수 있습니다. 이러한 설정 제어가 두 실행을 비교 가능하게 유지하는 요소입니다.
벤치마크 결과가 실행마다 다른 이유는 무엇입니까?
열 스로틀링, 백그라운드 프로세스, 모델의 콜드 스타트 로딩이 모두 단일 실행 결과에 영향을 미칩니다. 하나의 샘플을 신뢰하는 대신 여러 번 실행한 결과를 평균화하십시오 — llama-bench는 이를 자동으로 수행합니다.
프롬프트 처리 속도와 생성 속도 중 어느 것이 더 중요합니까?
작업에 따라 다릅니다. 긴 문서 요약은 입력을 읽는 작업이 대부분이므로 프롬프트 처리 속도가 지배적입니다. 대화형 채팅은 짧은 프롬프트 이후 모델이 대부분의 출력을 토큰 단위로 생성하므로 생성 속도가 지배적입니다.
온라인에서 찾은 초당 토큰 수치를 제 하드웨어와 비교할 수 있습니까?
모델, 양자화 수준, 컨텍스트 길이가 정확히 일치하는 경우에만 가능합니다. 이러한 세부 정보가 함께 제시되지 않은 초당 토큰 수치는 사용자의 설정과 비교할 수 없습니다. 포럼이나 소셜 미디어의 출처가 불명확한 수치는 벤치마크가 아니라 대략적인 일화로 취급하십시오.