Skip to main content
PromptQuorum

llama-bench: la mejor herramienta para medir la velocidad de un LLM local

llama-bench: la mejor herramienta para medir la velocidad de un LLM local

Esta página contiene enlaces de referencia a productos de terceros. PromptQuorum no participa en ningún programa de afiliados — son enlaces simples que no generan comisión. Hacer clic en los enlaces y los pasos siguientes son de su entera responsabilidad. Estos enlaces no representan ningún respaldo ni verificación por parte de PromptQuorum.

Respuesta rápida

llama-bench, incluida con llama.cpp, es la mejor herramienta para medir la velocidad de un LLM local — separa la velocidad de procesamiento del prompt de la velocidad de generación bajo una longitud de contexto y un nivel de cuantización fijos. Para una comprobación rápida de tu configuración actual, usa en su lugar la salida `--verbose` de Ollama.

  • Mejor benchmark en general: llama-bench — separa la velocidad de procesamiento del prompt de la velocidad de generación, controla la longitud de contexto y la cuantización.
  • Comprobación más rápida: Ollama --verbose — una cifra aproximada de tokens/seg desde una respuesta de chat normal, sin herramienta de benchmark aparte.
  • Mejor opción de interfaz gráfica: LM Studio — una lectura en vivo de tokens/seg mientras pruebas y comparas modelos, sin línea de comandos.
  • Mejor para comparaciones de hardware: llama-bench — la única opción aquí diseñada para ejecuciones controladas y reproducibles lado a lado.
Tool ComparisonsIntermedio

Puntos clave

  • llama-bench es la mejor herramienta de benchmarking en general — separa la velocidad de procesamiento del prompt de la velocidad de generación bajo configuraciones fijas y reproducibles
  • La opción --verbose de Ollama es la comprobación más rápida de si tu configuración es lo bastante rápida, no un sustituto de una comparación de hardware controlada
  • LM Studio es la mejor opción de interfaz gráfica para pruebas rápidas, experimentar con modelos y ver el rendimiento en vivo sin línea de comandos
  • Mantén el modelo, la cuantización y la longitud de contexto idénticos entre ejecuciones — comparar configuraciones distintas produce una cifra sin sentido
  • Ejecuta varias pasadas y promedia el resultado, y nunca confíes en una cifra de tokens/seg encontrada en línea sin sus configuraciones asociadas

Mejor opción: llama-bench

llama-bench es la opción por defecto correcta para quien necesite una cifra de velocidad repetible y comparable entre hardwares. Es parte de llama.cpp, se ejecuta desde la línea de comandos y reporta dos cifras separadas en cada prueba: velocidad de procesamiento del prompt (qué tan rápido lee el modelo la entrada) y velocidad de generación (qué tan rápido produce nuevos tokens). Estas dos cifras se comportan de forma muy distinta bajo carga, así que una herramienta que las combina en una sola cifra te oculta la mitad del panorama.

Recurre a llama-bench cuando compares dos GPU antes de una compra, pruebes un nuevo Mac o PC, compares niveles de cuantización, publiques resultados o decidas si vale la pena una actualización de hardware. Repite cada prueba automáticamente y reporta el promedio, así que no necesitas ejecutarlo cinco veces a mano.

La pregunta de seguimiento más común es qué controlan realmente las opciones de longitud de contexto y longitud de prompt/generación. En resumen: llama-bench te permite fijar la longitud del prompt de prueba y cuántos tokens genera, de forma independiente entre sí, para que puedas probar un intercambio corto tipo chat o un prompt largo tipo documento sin cambiar nada más de la ejecución — esa separación es lo que hace comparables dos resultados.

llama-bench no es un producto comercial — es una parte gratuita y de código abierto del proyecto llama.cpp en GitHub, incluida automáticamente cuando compilas o instalas llama.cpp.

Prueba rápida: Ollama --verbose

La opción `--verbose` de Ollama es la forma más rápida de comprobar si tu configuración actual se siente lo bastante rápida — no un reemplazo de llama-bench. Ejecutar ollama run <model> --verbose imprime una cifra de tokens/seg al final de una respuesta de chat normal, sin necesitar un paso de benchmark aparte.

La cifra proviene de una única generación no controlada, no de una ejecución repetida a contexto fijo, por lo que es más ruidosa y no adecuada para comparar dos piezas de hardware distintas. Úsala para responder "¿esto es usable para chatear ahora mismo?", y usa llama-bench cuando la respuesta tenga que sostenerse frente a otra máquina.

Ollama es gratuita y de código abierto — consulta el sitio de Ollama para instrucciones de instalación.

Mejor opción de interfaz gráfica: LM Studio

LM Studio es la mejor opción si quieres una lectura en vivo de tokens/seg sin tocar una terminal. Su interfaz de chat muestra la velocidad de generación en tiempo real, lo cual es conveniente para comprobaciones rápidas de hardware, experimentar con modelos y comparar cuantizaciones lado a lado mientras trabajas.

Al igual que la opción `--verbose` de Ollama, la lectura en vivo de LM Studio es conveniente más que rigurosa — no expone los controles de número de ejecuciones o longitud de contexto que hacen confiable un resultado de llama-bench para una decisión de compra de hardware. LM Studio tiene un nivel gratuito; las descargas están en el sitio de LM Studio.

Haz benchmarking antes de comprar

La pregunta real detrás de la mayoría de las búsquedas de benchmarking no es "qué herramienta debo usar", sino "qué hardware debo comprar". Una cifra genérica de tokens/seg del post de un desconocido no responde eso — ejecuta el mismo modelo, cuantización y longitud de contexto en las dos GPU que realmente estás considerando antes de decidir.

Una vez que tengas cifras reales de tus propias ejecuciones de llama-bench, compáralas con las opciones de nuestra guía de mejores GPU para LLM locales si te quedas en un equipo de escritorio, nuestra guía de mejores mini PC para LLM locales para un equipo compacto siempre encendido, o nuestra guía del comparativa Apple Silicon vs GPU NVIDIA si prefieres memoria unificada en lugar de una GPU discreta.

Qué hace útil a un benchmark

Una comparación útil mantiene constantes el modelo, el nivel de cuantización, la longitud de contexto y el contenido del prompt entre ejecuciones, y reporta la velocidad de procesamiento del prompt y la velocidad de generación por separado. Sin esos controles, una sola cifra de tokens/seg casi no te dice nada sobre cómo rendirá la misma configuración con un prompt más largo o una cuantización distinta.

Ejecuta varias pasadas y promedia el resultado — una sola ejecución se ve sesgada por el throttling térmico, procesos en segundo plano y la carga en frío del modelo. Trata una cifra de tokens/seg no atribuida de un foro o red social como una anécdota aproximada, no como un benchmark, a menos que el modelo, la cuantización y la longitud de contexto estén indicados junto a ella.

Conclusión

Para un benchmark serio y comparable entre hardwares, usa llama-bench. Para una comprobación rápida de tu configuración actual, usa la salida `--verbose` de Ollama. Para la experiencia de interfaz gráfica más sencilla con visualización de rendimiento en vivo, usa LM Studio. Y si el objetivo real es decidir qué comprar, haz benchmarking del modelo y la cuantización exactos que te importan en ambas máquinas antes de decidirte — luego compara al ganador con nuestras guías de GPU, mini PC o Mac.

Preguntas frecuentes

¿Qué controlan las opciones de tamaño de contexto y prompt/generación de llama-bench?
llama-bench te permite fijar cuántos tokens tiene el prompt de prueba y cuántos tokens genera, de forma independiente a la longitud de contexto usada para la ejecución — así puedes probar un escenario de contexto corto o largo sin cambiar nada más de la configuración. Ese control sobre las configuraciones es lo que mantiene comparables dos ejecuciones.
¿Por qué varían los resultados del benchmark entre ejecuciones?
El throttling térmico, los procesos en segundo plano y la carga en frío del modelo afectan los resultados de una sola ejecución. Promedia varias ejecuciones — llama-bench lo hace automáticamente — en lugar de confiar en una sola muestra.
¿Es más importante la velocidad de procesamiento del prompt o la de generación?
Depende de la tarea. El resumen de documentos largos está dominado por la velocidad de procesamiento del prompt, ya que la mayor parte del trabajo consiste en leer la entrada. El chat interactivo está dominado por la velocidad de generación, ya que el modelo produce la mayor parte de su salida token por token tras un prompt corto.
¿Puedo comparar una cifra de tokens/seg que encuentro en línea con mi propio hardware?
Solo si el modelo, el nivel de cuantización y la longitud de contexto coinciden exactamente. Una cifra de tokens/seg sin esos detalles no es comparable con tu configuración — trata los números no atribuidos de foros o redes sociales como anécdotas aproximadas, no como benchmarks.