Key Takeaways
- Apple M5 Pro (64 GB, ~2.399 $): la mejor opción todo-en-uno para la mayoría de usuarios. 40–60 tok/s en modelos de 30B, bajo consumo (~25 W en inferencia), sin límite de VRAM.
- NVIDIA RTX 5090 (32 GB, 2.000 $): el más rápido para modelos de 7B–14B a 150–200 tok/s. No puede cargar 30B+ sin CPU offloading. Ideal para cargas de trabajo en producción.
- NVIDIA RTX 5070 (12 GB, ~600 $): mejor GPU en relación calidad-precio. 60–80 tok/s en modelos de 8B. Limitado a 7B–8B a precisión completa.
- Apple M5 Max (64–128 GB, ~3.199 $+): 460–614 GB/s de ancho de banda. Ejecuta 30B–70B de forma nativa. Ideal para investigadores y usuarios intensivos de 30B+.
- Solo CPU (Ryzen/Intel modernos): 10–20 tok/s en modelos de 7B con RAM DDR5 rápida. Viable para uso ocasional, poco práctico para chat en tiempo real.
- Veredicto: para la mayoría, el Apple M5 Pro de 64 GB es el ganador — modelos más grandes que cualquier GPU individual, menor coste que una GPU dedicada, 10× menos consumo. Elige la serie RTX 50 solo para máxima velocidad en 7B–14B o cargas de producción.
Para LLMs locales: Apple M5 Pro 64 GB (~2.399 $) es el mejor todo-en-uno a 40–60 tok/s en modelos de 30B; RTX 5090 32 GB (~2.000 $) es el más rápido para 7B–14B (150–200 tok/s) pero imposible para 30B+; RTX 5070 12 GB (~600 $) ofrece el mejor valor GPU; solo CPU: 10–20 tok/s en 7B.
Las GPU son más rápidas en modelos pequeños (menos de 14B) por su alta capacidad de cómputo. Apple Silicon gana en modelos grandes (30B+) al integrar memoria y cómputo con bajo consumo. CPU solo es el más lento pero funciona en cualquier portátil.
Comparativa de rendimiento: velocidad y rendimiento sostenido
*Requiere CPU offloading — penalización de velocidad significativa y degradación de calidad a bit-widths bajos
| Hardware | Qwen3 8B | Qwen3 30B | Consumo | Coste |
|---|---|---|---|---|
| RTX 5090 (GPU, 32 GB GDDR7) | 150–200 tok/s | No posible* | ~450W | $2.000 |
| RTX 5080 (GPU, 16 GB GDDR7) | 100–130 tok/s | No posible* | ~360W | $1.000 |
| RTX 5070 Ti (GPU, 16 GB) | 80–100 tok/s | No posible* | ~300W | $750 |
| RTX 5070 (GPU, 12 GB) | 60–80 tok/s | No posible* | ~250W | $600 |
| MacBook Pro M5 Pro (36–64 GB, 307 GB/s) | 40–60 tok/s | 20–30 tok/s | ~25W | $2.399+ |
| MacBook Pro M5 Max (64–128 GB, 460–614 GB/s) | 60–80 tok/s | 35–50 tok/s | ~35W | $3.199+ |
| Mac mini M5 base (16–32 GB, 200 GB/s) | 25–35 tok/s | Offload* | ~15W | $599+ |
| Intel Core Ultra 9 / AMD Ryzen 9 (CPU, DDR5) | 10–20 tok/s | 3–5 tok/s | ~65W | Incluido |
Cuándo elegir GPU (serie RTX 50)
Elige una GPU NVIDIA de la serie RTX 50 cuando necesites máxima velocidad en modelos de 7B–14B o ejecutes cargas de producción 24/7.
- RTX 5090 (32 GB GDDR7, 1.792 GB/s): 150–200 tok/s en modelos de 8B. $2.000. Ideal para pipelines de producción, fine-tuning y aplicaciones donde la velocidad es crítica.
- RTX 5080 (16 GB GDDR7): 100–130 tok/s en 8B. $1.000. Buen equilibrio entre velocidad y coste para 8B–13B.
- RTX 5070 Ti / 5070 (12–16 GB): 60–100 tok/s en 8B. $600–$750. Mejor relación calidad-precio para chat y codificación de un solo usuario.
- Ventaja del ecosistema CUDA: vLLM, llama.cpp y LM Studio están todos optimizados de forma nativa. La inferencia más rápida a precisión nativa.
- Límite estructural: ninguna tarjeta de la serie RTX 50 carga modelos de 30B a calidad completa (requiere 20+ GB de VRAM). El offloading a RAM del sistema genera una penalización de velocidad de 5–10×.
El consumo energético es la contrapartida clave: la RTX 5090 consume 450 W bajo carga frente a 25 W del M5 Pro. A 0,35 $/kWh, la RTX 5090 cuesta ~55 $/mes adicionales de electricidad usándola 8 h/día.
Cuándo elegir Apple Silicon (M5)
Elige Apple Silicon M5 cuando necesites ejecutar modelos de 14B–70B, valores la eficiencia energética o uses macOS como sistema principal.
- M5 base (16–32 GB, 200 GB/s): ejecuta 7B–8B de forma nativa a 25–35 tok/s. Desde 599 $ (Mac mini). Buen punto de entrada.
- M5 Pro (36–64 GB, 307 GB/s): ejecuta hasta 30B de forma nativa a 20–30 tok/s. ~2.399 $ (MacBook Pro). El mejor valor todo-en-uno.
- M5 Max (64–128 GB, 460–614 GB/s): ejecuta 30B–70B de forma nativa a 35–50 tok/s. ~3.199 $+. Ideal para investigadores y cargas intensivas de 70B.
- Ventaja de la memoria unificada: sin límite de VRAM. Un M5 Pro de 64 GB carga modelos de 30B de forma nativa; un M5 Max de 128 GB carga modelos de 70B de forma nativa.
- Datos de Apple: 4× más velocidad de inferencia de LLM frente al M4 en la generación M5.
- Framework MLX: MLX de Apple está optimizado para Apple Silicon. Los modelos Qwen3 funcionan excelentemente en MLX. DeepSeek-R1 14B rinde bien.
Contrapartida: no puede igualar la velocidad bruta de la RTX 5090 en 7B. Más lento para fine-tuning. Sin herramientas exclusivas de CUDA.
Cuándo solo CPU es suficiente
La inferencia solo con CPU es viable si solo necesitas respuestas ocasionales y ejecutas modelos pequeños (7B Q4).
- Intel Core Ultra 9 / AMD Ryzen 9 modernos con DDR5-5600: 10–20 tok/s en Qwen3 8B o Llama 3.2 8B. Utilizable para tareas por lotes no interactivas.
- CPU antigua / DDR4: 5–8 tok/s. Latencia notable (5–8 segundos por respuesta) que hace el chat interactivo desagradable.
- Sin coste de hardware adicional: si ya tienes un equipo de escritorio capaz, llama.cpp u Ollama funcionan de inmediato.
- Consumo energético: las CPU a plena carga de inferencia consumen 65–125 W — menos que una GPU, más que Apple Silicon.
La inferencia por CPU sirve para: resúmenes de documentos por lotes, procesamiento nocturno, preguntas ocasionales. Evita solo CPU para chat en tiempo real, asistentes de codificación o modelos mayores de 8B.
Ancho de banda de memoria: el verdadero cuello de botella
La inferencia de LLMs está limitada por la memoria, no por el cómputo. La velocidad de generación de tokens está limitada por la rapidez con que se pueden cargar los pesos del modelo desde la memoria. Mayor ancho de banda de memoria = generación de tokens más rápida.
La fórmula: Velocidad de inferencia ≈ Ancho de banda de memoria ÷ Pesos del modelo en memoria
- La RTX 5090 con 1.792 GB/s tiene el ancho de banda de una sola GPU más rápido disponible en 2026.
- El M5 Max con 460–614 GB/s iguala o supera a la RTX 5080 en ancho de banda — con 128 GB de memoria unificada frente a 16 GB de VRAM.
- El M5 Pro con 307 GB/s es el punto óptimo: suficiente ancho de banda para modelos de 30B, la mitad del coste del M5 Max.
- La RAM DDR5 de CPU a 89 GB/s es 20× más lenta que la RTX 5090 pero 4× más rápida que DDR4 — una mejora significativa para inferencia por CPU.
- Ventaja de la memoria unificada: sin sobrecarga de transferencia CPU↔GPU. El M5 Pro mantiene un modelo de 30B completamente en su pool de 64 GB.
| Plataforma | Ancho de banda de memoria | Velocidad efectiva (8B) |
|---|---|---|
| RTX 5090 (GDDR7) | 1.792 GB/s | 150–200 tok/s |
| RTX 5080 (GDDR7) | 960 GB/s | 100–130 tok/s |
| RTX 5070 (GDDR7) | 672 GB/s | 60–80 tok/s |
| M5 Max (unificada, 128 GB) | 460–614 GB/s | 60–80 tok/s |
| M5 Pro (unificada, 64 GB) | 307 GB/s | 40–60 tok/s |
| M5 base (unificada, 32 GB) | 200 GB/s | 25–35 tok/s |
| RAM DDR5-5600 (solo CPU) | 89 GB/s | 10–20 tok/s |
| RAM DDR4-3200 (solo CPU) | 51 GB/s | 5–8 tok/s |
Coste por tok/s: análisis de valor real
El coste por tok/s compara el valor del hardware: coste inicial dividido entre la velocidad de tokens sostenida.
La RTX 5070 tiene el mejor coste por tok/s en velocidad pura. El M5 Pro gana en energía: a 0,15 $/kWh usándolo 8 h/día, el M5 Pro cuesta ~1,10 $/mes frente a ~16,50 $/mes de la RTX 5090.
Si ya tienes un Mac con M5 Pro, el coste por tok/s es efectivamente 0 $ en la parte de hardware.
| Hardware | Coste inicial | Tok/s (8B) | Coste por tok/s | Consumo (inferencia) |
|---|---|---|---|---|
| RTX 5090 (32 GB) | $2.000 | 175 | $11,4 | 450W |
| RTX 5070 (12 GB) | $600 | 70 | $8,6 | 250W |
| M5 Pro MacBook Pro (64 GB) | $2.399 | 50 | $48 | 25W |
| M5 Max MacBook Pro (128 GB) | $3.199 | 70 | $46 | 35W |
| CPU (escritorio DDR5 moderno) | Incluido | 15 | $0 | 65W |
Guía de decisión por plataforma
Marco de decisión según tamaño del modelo, presupuesto y caso de uso:
- Elige RTX 5090 / 5080: máxima velocidad en 7B–14B, pipelines de producción, fine-tuning, cargas de servidor 24/7.
- Elige RTX 5070 / 5070 Ti: mejor valor GPU para chat y codificación de un solo usuario en 7B–13B. 600–750 $.
- Elige M5 Pro (64 GB): la mejor opción todo-en-uno para la mayoría. Ejecuta 30B de forma nativa, bajo consumo, flujo de trabajo macOS. ~2.399 $.
- Elige M5 Max (128 GB): uso en investigación, modelos de 70B de forma nativa, máximo rendimiento de Apple Silicon. ~3.199 $+.
- Solo CPU: cero inversión adicional, uso ocasional de 7B, procesamiento por lotes nocturno.
Errores comunes al elegir hardware
- Elegir GPU para modelos de 30B+. Ninguna tarjeta de la serie RTX 50 carga 30B en VRAM. El offloading a RAM genera una penalización de velocidad de 5–10×. Usa M5 Pro o M5 Max en su lugar.
- Asumir que el M5 base (16 GB) es suficiente. Solo carga 7B. Para modelos de 14B necesitas 32 GB; para 30B necesitas 64 GB (M5 Pro).
- Ignorar el coste energético de servidores GPU siempre encendidos. La RTX 5090 a 8 h/día equivale a ~200 $/año en electricidad a 0,15 $/kWh. El M5 Pro: ~14 $/año.
- Comprar una RTX 5090 para chat de 8B. La RTX 5070 a 600 $ ofrece 70 tok/s en 8B — el 80% de la velocidad al 30% del coste.
- Esperar que la CPU sea viable para chat en tiempo real. Incluso 20 tok/s se siente lento. 5–8 tok/s en DDR4 es inutilizable para uso interactivo.
Preguntas frecuentes
¿Es mejor la GPU o la CPU para ejecutar LLMs locales?
Para inferencia en tiempo real, la GPU NVIDIA es más rápida: la RTX 5070 ejecuta modelos de 8B a 60–80 tok/s frente a 10–20 tok/s en una CPU moderna con DDR5. Sin embargo, el Apple M5 Pro a 40–60 tok/s también supera a la CPU y añade la capacidad de ejecutar modelos de 30B de forma nativa.
¿Puede Apple Silicon ejecutar LLMs locales?
Sí. La serie Apple M5 ejecuta modelos de 7B a 25–80 tok/s según el nivel de chip. El M5 Pro (64 GB) ejecuta modelos de 30B de forma nativa a 20–30 tok/s — algo que ninguna GPU de consumo puede igualar. El M5 Max (128 GB) ejecuta modelos de 70B de forma nativa a 35–50 tok/s.
¿Cuánta VRAM mínima necesita una GPU para LLMs locales?
12 GB de VRAM (RTX 5070) ejecutan modelos de 7B–8B con cuantización Q4–Q8 sin problemas. 16 GB (RTX 5080) manejan modelos de 13B. Se necesitan 24–32 GB para modelos de 30B, pero ninguna GPU de consumo individual carga 30B por completo — usa el Apple M5 Pro de 64 GB en su lugar.
¿Cuánto más rápida es la GPU frente a la CPU en inferencia de LLMs?
La RTX 5090 es 8–15× más rápida que una CPU moderna con DDR5 para modelos de 8B (175 tok/s frente a 15 tok/s). La diferencia proviene del ancho de banda de memoria: 1.792 GB/s (GDDR7) frente a 89 GB/s (DDR5). El Apple M5 Pro con 307 GB/s se sitúa entre ambos, a 40–60 tok/s.
¿Vale la pena comprar una GPU solo para LLMs locales?
La RTX 5070 (600 $) amortizada en 3 años cuesta menos que las tarifas de la API de OpenAI para usuarios intensivos que usan 2+ horas al día. A 70 tok/s gestiona chat en tiempo real y asistencia de codificación. Si necesitas modelos de 30B+, el M5 Pro ofrece mejor valor pese a su coste inicial más alto.
¿Qué es el ancho de banda de memoria y por qué importa para los LLMs?
La inferencia de LLMs está limitada por la memoria. La velocidad de tokens ≈ ancho de banda de memoria ÷ pesos del modelo. RTX 5090: 1.792 GB/s. M5 Max: 460–614 GB/s. M5 Pro: 307 GB/s. CPU DDR5: 89 GB/s. Por eso Apple Silicon con memoria unificada puede ejecutar modelos grandes de forma eficiente pese a un ancho de banda bruto menor que las GPU superiores.
¿Qué chip Apple Silicon es mejor para LLMs locales en 2026?
El M5 Pro (64 GB, 307 GB/s) es el mejor todo-en-uno para la mayoría — ejecuta modelos de 30B de forma nativa a 20–30 tok/s por ~2.399 $. El M5 Max (128 GB, 460–614 GB/s) para modelos de 70B a 35–50 tok/s (~3.199 $+). Evita el M5 base (16 GB) para cualquier cosa más allá de 7B.
¿Puede Apple Silicon ejecutar modelos de 30B y 70B?
El M5 Pro (64 GB) ejecuta modelos de 30B de forma nativa a 20–30 tok/s. El M5 Max (128 GB) ejecuta modelos de 70B de forma nativa a 35–50 tok/s. Son cifras de rendimiento reales sin offloading a CPU — ninguna GPU de consumo puede igualarlo para 30B+.
¿Vale la pena la RTX 5090 por 2.000 $ para LLMs locales?
Solo si tu flujo de trabajo requiere modelos de 7B–14B a máxima velocidad o ejecutas pipelines de inferencia en producción. Para la mayoría, la RTX 5070 (600 $) ofrece el 80% de la velocidad al 30% del coste. Para modelos de 30B+, el M5 Pro es la mejor opción sin importar el presupuesto.
¿Cómo se compara el consumo energético entre GPU y Apple Silicon?
La RTX 5090 consume ~450 W en carga de inferencia. El M5 Pro consume ~25 W. A 8 h/día y 0,15 $/kWh, eso equivale a 200 $/año (RTX 5090) frente a 14 $/año (M5 Pro). Para usuarios domésticos y quienes pagan tarifas eléctricas comerciales, la eficiencia energética del M5 Pro supone una ventaja de coste significativa.
¿Qué tan rápida es la inferencia LLM en un MacBook Pro Intel (i9, 16 GB de RAM)?
Más lenta que Apple Silicon y más lenta que un escritorio moderno con DDR5. Los MacBook Pro Intel no tienen una vía de GPU de memoria unificada para llama.cpp — la inferencia se ejecuta solo en CPU sobre DDR4, con aproximadamente 38–45 GB/s de ancho de banda de doble canal frente a 89 GB/s de un CPU de escritorio DDR5 moderno. Usando la fórmula ancho de banda de memoria ÷ tamaño del modelo de arriba, un modelo cuantizado de 7B (~4,5 GB en Q4) alcanza alrededor de 8–10 tok/s teóricos, 4–7 tok/s realistas una vez que se contabiliza la sobrecarga de cómputo de la CPU. Los 16 GB de RAM total también te limitan a cerca de 7B–8B en Q4 con margen para el sistema operativo — no esperes ejecutar modelos de 13B+ sin un intercambio de memoria intenso y una gran penalización de velocidad.
¿Cuál es la diferencia entre pp tok/s y tg tok/s?
pp tok/s (procesamiento de prompt) mide qué tan rápido el modelo ingiere tu prompt de entrada — la fase de "prefill", que depende del cómputo y escala bien con hardware paralelo como las GPU. tg tok/s (generación de tokens) mide qué tan rápido genera cada nuevo token de salida — la fase de "decode", que depende del ancho de banda de memoria (ver la fórmula de ancho de banda de arriba). Las GPU normalmente muestran una brecha grande entre pp/tg (prefill rápido, generación limitada por el ancho de banda); la memoria unificada de Apple Silicon mantiene ambas cifras más cercanas entre sí. Al comparar benchmarks, siempre verifica qué número estás leyendo — pp y tg pueden diferir entre 5 y 20 veces en el mismo hardware.
Fuentes
- Especificaciones de GPU NVIDIA — Especificaciones de GPU series RTX 40/50, VRAM, ancho de banda de memoria.
- Rendimiento Apple M3 — Arquitectura de memoria unificada M5 Max y rendimiento de inferencia.
- Benchmarks vLLM — Benchmarks de rendimiento de inferencia de LLMs en producción.
- Diferentes hardware producen distintas tasas de tokens, pero toda inferencia se beneficia de prompts estructurados. Las solicitudes de contexto largo requieren técnicas distintas a las cortas: ventanas de contexto explicadas cubre estrategias para cualquier hardware.
