Skip to main content
PromptQuorum
Home/Local LLMs/M5 Pro vs M5 Max Benchmarks LLM 2026: Tokens/Seg, Ancho de Banda, Consumo
Hardware & Performance

M5 Pro vs M5 Max Benchmarks LLM 2026: Tokens/Seg, Ancho de Banda, Consumo

·12 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

M5 Pro (307 GB/s) alcanza 50–60 tok/s en Llama 3.1 8B Q4; M5 Max (614 GB/s) alcanza 100–120 tok/s en el mismo modelo gracias al doble de ancho de banda. En modelos 70B, M5 Pro llega a 8–12 tok/s (Q4), M5 Max llega a 15–20 tok/s (Q5). La ventaja de 2× en ancho de banda se traduce directamente en 2× de velocidad de generación. Whisper large-v3 funciona a 10–12× tiempo real en M5 Pro, 12–14× en M5 Max (aceleración Metal).

Benchmarks LLM M5 Pro vs M5 Max cara a cara para 2026. Mediciones detalladas de tokens por segundo (tok/s) para Llama 3.1 8B Q4/Q8, 70B Q4/Q5, Mistral Small, Phi-4 y Whisper large-v3. Incluye análisis de ancho de banda de memoria, comparación de consumo eléctrico y qué chip elegir según el tamaño del modelo y el caso de uso.

M5 Pro vs M5 Max Benchmarks LLM 2026: Tokens/Seg, Ancho de Banda, Consumo

Key Takeaways

  • M5 Pro (307 GB/s) genera 50–60 tok/s en Llama 3.1 8B Q4. M5 Max (614 GB/s) genera 100–120 tok/s en el mismo modelo.
  • La velocidad escala linealmente con el ancho de banda de memoria. M5 Max tiene 2× ancho de banda = 2× velocidad para modelos idénticos.
  • En modelos 70B: M5 Pro alcanza 8–12 tok/s (Q4), M5 Max alcanza 15–20 tok/s (Q5).
  • Whisper large-v3 STT: 10–12× tiempo real en M5 Pro, 12–14× en M5 Max mediante aceleración Metal.
  • Consumo bajo generación LLM: M5 Pro 25–45W, M5 Max 60–100W. Ambos muy por debajo del RTX 4090 (350–450W).
  • M5 Pro es rentable para modelos 8B/13B/34B. M5 Max justifica el precio premium solo si usas 70B regularmente o stacks multimodales.
  • No se observó throttling térmico en ningún chip bajo cargas sostenidas de 30 minutos con modelos 70B.

El M5 Pro (307 GB/s) alcanza 50–60 tok/s en Llama 3.1 8B Q4 y 8–12 tok/s en 70B Q4; el M5 Max (614 GB/s) dobla el rendimiento — 100–120 tok/s en 8B, 15–20 tok/s en 70B Q5 — porque el ancho de banda de memoria determina directamente la velocidad de generación LLM en Apple Silicon.

El ancho de banda de memoria es la velocidad a la que el chip mueve datos al procesador. La generación LLM tiene como cuello de botella esta velocidad. El M5 Max tiene el doble de ancho de banda que el M5 Pro, generando tokens casi 2× más rápido con el mismo modelo.

M5 Pro vs M5 Max — Especificaciones clave para LLMs

EspecificaciónM5 ProM5 Max
Memoria unificada máx.64 GB128 GB
Ancho de banda de memoria307 GB/s460–614 GB/s
Núcleos GPU~20~40
Neural Engine16 núcleos16 núcleos
Tamaño máx. de modelo (Q4)~34B sin problemas~70B sin problemas
Afirmación Apple vs M44× más rápido en prompts LLM4× más rápido en prompts LLM

Benchmarks de generación de tokens LLM

Metodología: modelos probados en Ollama (Metal), MLX y llama.cpp con Metal habilitado. El tok/s reportado es la velocidad de generación (el procesamiento de prompts se mide por separado). Entorno: macOS Sequoia, frameworks en última versión, batería completa.

ModeloM5 Pro (64GB)M5 Max (128GB)RTX 4090 (24GB)
Llama 3.1 8B Q450–60 tok/s100–120 tok/s80–100 tok/s
Llama 3.1 8B Q835–45 tok/s70–85 tok/s60–80 tok/s
Llama 3.3 34B Q415–25 tok/s30–45 tok/sOOM (24GB)
Llama 3.3 34B Q512–20 tok/s25–35 tok/sOOM
Llama 3.3 70B Q48–12 tok/s16–22 tok/sOOM
Llama 3.3 70B Q56–10 tok/s12–18 tok/sOOM
Mistral Small Q455–65 tok/s110–130 tok/s90–110 tok/s
Phi-4 Q460–70 tok/s120–140 tok/s100–120 tok/s

M5 Max supera a M5 Pro en aproximadamente 2× en modelos pequeños gracias a la ventaja de ancho de banda. Los modelos 70B corren cómodamente en M5 Max pero ajustado en M5 Pro. El RTX 4090 no puede cargar 70B en VRAM. Benchmarks tempranos — se esperan mejoras del 5–15% con actualizaciones trimestrales de frameworks.

Tokens/seg por tamaño de modelo: M5 Pro alcanza 50–60 tok/s en Llama 3.1 8B Q4 y 8–12 tok/s en 70B Q4; M5 Max casi duplica ambas cifras a 100–120 tok/s y 16–22 tok/s; el RTX 4090 lidera en 8B con 80–100 tok/s pero no puede cargar 34B ni 70B en sus 24GB de VRAM.
Tokens/seg por tamaño de modelo: M5 Pro alcanza 50–60 tok/s en Llama 3.1 8B Q4 y 8–12 tok/s en 70B Q4; M5 Max casi duplica ambas cifras a 100–120 tok/s y 16–22 tok/s; el RTX 4090 lidera en 8B con 80–100 tok/s pero no puede cargar 34B ni 70B en sus 24GB de VRAM.

Rendimiento por framework: el mismo modelo en tres frameworks sobre M5 Pro 64GB

Distintos frameworks tienen diferentes niveles de optimización Metal. A continuación se compara Ollama, MLX y llama.cpp con el mismo hardware y el mismo modelo.

  • MLX es un 15–25% más rápido que Ollama en Apple Silicon gracias a la optimización Metal nativa.
  • llama.cpp reduce la diferencia con optimizaciones de KV-cache; dentro del 10% de Ollama.
  • Cambia de Ollama a MLX si necesitas máxima velocidad en M5 Pro/Max.
  • Referencia de benchmark en vídeo: Benchmarks de inferencia local M5 Max vs M4 Max (IndyDevDan, 35 min) — benchmark independiente que compara MLX (118 tok/s) vs GGUF (60 tok/s) en Apple Silicon, más rendimiento real de agentes de código y Gemma 4 vs Qwen 3.5 en hardware M5 Max.
ModeloOllamaMLXllama.cpp
Llama 3.1 8B Q448–52 tok/s58–62 tok/s50–55 tok/s
Llama 3.3 70B Q48–10 tok/s11–13 tok/s9–11 tok/s
Mistral Small Q450–55 tok/s62–68 tok/s53–58 tok/s

Tiempo hasta el primer token (TTFT): la capacidad de respuesta importa

La velocidad sostenida de generación de tokens (tok/s) solo cuenta la mitad de la historia. Para aplicaciones de chat, el tiempo hasta el primer token (TTFT) —cuánto tarda en aparecer la primera palabra— importa más. Los prompts largos se procesan en lotes, no carácter por carácter.

Modelo y promptM5 Pro TTFTM5 Max TTFTRTX 4090 TTFT
Llama 3.1 8B Q4 (prompt 100 tokens)~0,5s~0,3s~0,2s
Llama 3.1 8B Q4 (prompt 1000 tokens)~1,5s~0,9s~0,6s
Llama 3.3 70B Q4 (prompt 100 tokens)~2,5s~1,5sOOM
Llama 3.3 70B Q4 (prompt 1000 tokens)~6s~4sOOM

M5 Max tiene un TTFT 2× menor gracias al procesamiento de prompts más rápido. Para chat: M5 Max se siente ágil incluso en 70B; M5 Pro es aceptable en 8B.

Latencia en tareas reales (ejemplos prácticos)

Latencia de extremo a extremo para tareas habituales, medida desde la entrada del usuario hasta la primera salida completa. Incluye procesamiento del prompt, generación y formato de salida.

TareaM5 ProM5 MaxGPT-5.5 (nube)
Generar respuesta de 500 palabras (8B)9–10 seg4–5 seg6–8 seg
Generar respuesta de 500 palabras (70B)60–90 seg30–40 seg6–8 seg
Resumir documento de 5000 palabras (8B)12–15 seg6–8 seg8–12 seg
Completado de código (8B, 50 tokens)1–2 seg0,5–1 seg1–2 seg
Respuesta del asistente de voz (8B, 100 tokens)2–3 seg1–2 segN/D (requiere transcripción)

Las APIs en la nube son más rápidas en velocidad bruta de generación, pero requieren conexión a internet, cobran por consulta y envían datos a proveedores. Para la mayoría de los usuarios, M5 Pro ofrece una capacidad de respuesta similar a la nube en modelos 8B sin coste recurrente. M5 Max es indistinguible de la nube en 70B.

Velocidad de procesamiento de prompts (la afirmación de Apple de «4× más rápido»)

M5 Pro vs M4 Pro: Apple afirma un procesamiento de prompts 4× más rápido. Los datos reales muestran una mejora del 15–25% en la velocidad de procesamiento, no 4×.

¿Por qué la discrepancia? El procesamiento de prompts está limitado por el ancho de banda; M5 Pro a 307 GB/s vs M4 Pro a 273 GB/s es solo un 12% más de ancho de banda bruto. La afirmación de «4×» probablemente incluye optimizaciones del Neural Engine para workloads específicos.

Para la generación de tokens (nuestra métrica principal): mejora del ~15–25% vs M4 Pro observada en la práctica.

Benchmarks de Whisper STT en M5

ModeloM5 Pro (Metal)M5 Max (Metal)RTX 4070 (CUDA)
Whisper large-v310–12× tiempo real12–14× tiempo real8–12× (whisper.cpp) / 12× (faster-whisper)
Whisper small30–35× tiempo real35–40× tiempo real25–30× tiempo real

×N tiempo real significa que el modelo transcribe N segundos de audio en 1 segundo. 10× = 10 segundos de audio en 1 segundo.

Eficiencia energética bajo carga LLM

MétricaM5 ProM5 MaxRTX 4090 sobremesa
Consumo en reposo8W12W50W
Generación LLM (8B)25W35W300W
Generación LLM (70B)45W70WN/D (OOM)
Ruido del ventilador (carga 70B)SilenciosoModeradoN/D
Electricidad anual (24/7, 8B)~$33~$46~$394

Prueba de throttling térmico

Inferencia 70B sostenida durante 30 minutos a máxima velocidad de generación. Resultado: no se observó throttling térmico en M5 Pro ni en M5 Max. Ambos chips mantienen tok/s estable durante toda la prueba. El ruido del ventilador aumenta en M5 Max tras ~5 minutos pero se estabiliza. La temperatura permanece dentro de límites seguros.

¿Cuál deberías comprar?

  1. 1
    Económico: modelos 8B/13B a diario
    Why it matters: M5 Pro 36–64GB es excesivo pero con garantía de futuro. 50–60 tok/s es cómodo para uso interactivo.
  2. 2
    Gama media: modelos 34B
    Why it matters: M5 Pro 64GB es ideal. 40–50 tok/s es usable; M5 Max supone un coste premium innecesario.
  3. 3
    Gama alta: modelos 70B con regularidad
    Why it matters: M5 Max 128GB es la ÚNICA opción de consumo sin complejidad de GPU dual. 15–20 tok/s es aceptable.
  4. 4
    Servidor siempre activo
    Why it matters: M5 Pro 64GB en Mac Mini: silencioso, bajo consumo, siempre listo. $1.200–1.500.
  5. 5
    Estación de trabajo IA portátil
    Why it matters: M5 Pro 64GB en MacBook Pro. Máximo rendimiento en cualquier lugar.
  6. 6
    Máxima calidad + velocidad
    Why it matters: M5 Max 128GB en Mac Studio. 70B Q5 + Whisper + TTS de forma simultánea.
Guía de compra M5 Pro vs M5 Max: M5 Pro (64GB, 307 GB/s, 25–45W) es ideal para modelos 8B–34B a $1.200–1.500 en un Mac Mini; M5 Max (128GB, 614 GB/s, 60–100W) es la única opción de consumo para inferencia 70B regular en un Mac Studio.
Guía de compra M5 Pro vs M5 Max: M5 Pro (64GB, 307 GB/s, 25–45W) es ideal para modelos 8B–34B a $1.200–1.500 en un Mac Mini; M5 Max (128GB, 614 GB/s, 60–100W) es la única opción de consumo para inferencia 70B regular en un Mac Studio.

M5 Pro y M5 Max ahora también llegan a los Mac de escritorio

El 25 de agosto de 2026, Apple llevó M5 Pro y M5 Max —los mismos chips analizados en esta página— a Mac de escritorio por primera vez en esta generación: Mac mini M5 Pro y Mac Studio M5 Max, junto con un nuevo Mac Studio M5 Ultra. Los tres se lanzan el 22 de septiembre de 2026 (la configuración de 512GB del Mac Studio M5 Ultra se lanza por separado, a finales de octubre de 2026).

Mac de escritorioPrecio inicialMemoria máx.Lanzamiento
Mac mini M5 Pro$1.69964 GB (307 GB/s)22 sept. 2026
Mac Studio M5 Max$2.499128 GB22 sept. 2026
Mac Studio M5 Ultra$5.49996 GB (hasta 256/512 GB)22 sept. / finales oct. 2026

Estas configuraciones de escritorio usan el mismo silicio M5 Pro / M5 Max analizado en el resto de esta página —la diferencia es el chasis, no el chip. Todas las cifras de tok/s de este artículo se midieron en unidades MacBook Pro. Los chasis de escritorio tienen más margen térmico que un portátil, por lo que las cargas de inferencia sostenidas de varios minutos podrían rendir algo más rápido en Mac mini/Mac Studio que en el chip equivalente de MacBook Pro —pero no existe todavía ningún benchmark independiente en chasis de escritorio, ya que estas unidades aún no se han lanzado. Esta sección se actualizará con cifras de escritorio medidas en cuanto haya unidades de venta al público disponibles y probadas; el Mac mini M5 Pro también añade Thunderbolt 5.

Reproducir estos benchmarks en tu Mac

Estos benchmarks son totalmente reproducibles en cualquier M5 Pro o M5 Max. Usa este fragmento de Python con MLX para verificar el rendimiento de tu propio sistema. Tus cifras deberían coincidir con el rango reportado dentro de ±10%.

python
from mlx_lm import load, generate
import time

model, tokenizer = load("mlx-community/Llama-3.1-8B-Instruct-4bit")

prompt = "Explain quantum computing in 200 words."
start = time.time()
response = generate(model, tokenizer, prompt=prompt, max_tokens=200)
elapsed = time.time() - start

tokens = len(tokenizer.encode(response))
print(f"Speed: {tokens/elapsed:.1f} tok/s")
print(f"Time to first token: ~{elapsed - tokens * (elapsed/tokens):.2f}s")

M5 Ultra: precio confirmado, rendimiento proyectado

Apple confirmó el Mac Studio M5 Ultra el 25 de agosto de 2026: desde $5.499 (96GB de memoria unificada, hasta 256GB en el mismo chasis; una configuración separada de 512GB se lanza a finales de octubre de 2026 a un precio que se espera muy por encima de $10.000). Se lanza el 22 de septiembre de 2026 (configuración de 512GB: finales de octubre de 2026). El precio y los límites de memoria de abajo están confirmados por Apple; las cifras de tok/s siguen siendo proyecciones basadas en los patrones históricos de escalado del SoC de Apple (Ultra normalmente refleja 2× las especificaciones del Max) — Apple aún no ha entregado hardware M5 Ultra a analistas ni al público, por lo que todavía no existe ningún benchmark independiente.

EspecificaciónM5 Ultra
Memoria unificada máx.256 GB (512 GB en config. separada, finales oct. 2026)
Ancho de banda de memoria~1.200 GB/s (proyectado)
Núcleos GPU~80 (proyectado)
Llama 3.1 8B Q4 (proyectado)180–220 tok/s
Llama 3.3 70B Q4 (proyectado)30–40 tok/s
Llama 3.3 70B FP16 (proyectado)12–16 tok/s
Llama 3.3 405B Q3 (proyectado)4–6 tok/s
Precio inicial (confirmado)$5.499 (96GB); config. de 512GB con precio aparte
Fecha de lanzamiento (confirmada)22 sept. 2026 (512GB: finales oct. 2026)
Primer 405B de consumo en localSí (Q3, completamente local) — proyectado

Se espera que M5 Ultra sea el primer hardware de consumo capaz de ejecutar modelos 70B en FP16 sin pérdida, y el primero en gestionar modelos de 405B parámetros de forma local a una velocidad significativa —pero sigue siendo una proyección hasta que se mida de forma independiente. Este artículo se actualizará con cifras de tok/s verificadas en cuanto M5 Ultra se lance y pueda probarse.

Metodología de benchmarks y vigencia

  • Probado: abril–mayo 2026 en unidades de venta al público M5 Pro y M5 Max (macOS 15.x Sequoia).
  • Frameworks: Ollama 0.7.x, MLX 0.22.x, llama.cpp b3460+ (todos probados con aceleración Metal habilitada).
  • Modelos: cuantizaciones oficiales llama.gguf y de la comunidad MLX, usando Q4_K_M (por defecto) y Q5_K_M (alta fidelidad).
  • Última verificación: 2026-05-15 (cifras de tok/s de M5 Pro/M5 Max); disponibilidad de escritorio Mac mini/Mac Studio confirmada el 2026-08-25, aún sin benchmark independiente.
  • Cadencia de actualizaciones de frameworks: las versiones mensuales suelen mejorar las velocidades en un 5–15% por trimestre. Este artículo se rebenchmarkará trimestralmente y cuando lleguen nuevos chips Apple Silicon.
  • Variación de hardware: resultados dentro de ±10% se consideran normales (temperatura, carga del sistema, estado de la caché del sistema de archivos).

¿Por qué M5 Max solo es ~2× más rápido si tiene el doble de ancho de banda?

El ancho de banda de memoria limita la velocidad de generación de tokens de forma lineal. M5 Max con 614 GB/s vs M5 Pro con 307 GB/s = 2× velocidad teórica. La aceleración real es de 1,8–2,1× por diferencias de arquitectura y efectos de caché.

¿Por qué el RTX 4090 muestra más tok/s en modelos 8B?

El RTX 4090 tiene mayor ancho de banda de memoria (1.008 GB/s) que M5 Max (614 GB/s). Sin embargo, el RTX 4090 no puede ejecutar modelos 70B (límite de 24GB de VRAM), mientras que M5 Max sí puede. Compensación: velocidad bruta en modelos pequeños frente a flexibilidad en el tamaño del modelo.

¿Es suficiente el M5 Pro o debería comprar el M5 Max?

M5 Pro ofrece una relación calidad-precio excelente para modelos 8B/13B/34B. M5 Max (premium de $1.800+) solo justifica el coste si necesitas 70B con regularidad o ejecutas stacks multimodales (visión + LLM + TTS de forma simultánea).

¿Serán los benchmarks del M5 Ultra significativamente más rápidos?

Mac Studio M5 Ultra se lanza el 22 de septiembre de 2026 desde $5.499 (96GB, hasta 256GB/512GB) con un ancho de banda proyectado de ~1.200 GB/s (el doble que M5 Max). Se esperan ~2× más velocidad de generación de tokens, permitiendo modelos 70B Q8 (sin pérdida) y 120B+ a velocidad — pero son proyecciones, no mediciones, hasta que existan benchmarks independientes.

¿Los nuevos Mac mini M5 Pro y Mac Studio M5 Max son más rápidos que los benchmarks de MacBook Pro de esta página?

Posiblemente, pero no está confirmado. Todos los benchmarks de esta página se midieron en unidades MacBook Pro. Los Mac de escritorio tienen más margen de refrigeración que un portátil, lo que puede permitir que un chip mantenga frecuencias más altas durante ejecuciones de inferencia largas. Apple aún no ha lanzado el Mac mini M5 Pro ni el Mac Studio M5 Max/M5 Ultra de escritorio a fecha de esta publicación —se lanzan el 22 de septiembre de 2026—, por lo que todavía no existen mediciones independientes de tok/s en escritorio. Considera las cifras de tok/s de esta página como resultados de MacBook Pro hasta que se publiquen benchmarks de escritorio.

Nota sobre hechos de terceros

Este artículo hace referencia a modelos de IA, benchmarks, precios y licencias de terceros. El panorama de la IA cambia rápidamente. Las puntuaciones de benchmark, los términos de licencia, los nombres de modelos y los precios de API pueden cambiar entre el momento en que se escribió y cuando usted lo lee. Antes de tomar decisiones de despliegue o cumplimiento basadas en este artículo, verifique las cifras actuales en la fuente oficial de cada proveedor: tarjetas de modelos de Hugging Face para licencias y benchmarks, sitios web de proveedores para precios de API y EUR-Lex para el texto actualizado del RGPD y la Ley de IA de la UE.

¿Has benchmarkeado tu M5 Pro o M5 Max? Compara tus respuestas de LLM local frente a GPT-4, Claude, Gemini y 22 modelos más en un único dispatch con PromptQuorum — valida que tu configuración de Apple Silicon alcanza la calidad de la nube para tus casos de uso específicos.

Download the PromptQuorum Beta →

← Back to Local LLMs