Key Takeaways
- ✅ NUEVO (25 de agosto de 2026): Mac mini M5 Pro desde $1,699 (hasta 64 GB, 307 GB/s) — el Mac con M5 Pro más barato jamás ofrecido.
- ✅ CONFIRMADO, DISPONIBLE 22 SEPT. 2026: Mac Studio M5 Max desde $2,499 (hasta 128 GB, 614 GB/s) y Mac Studio M5 Ultra desde $5,499 (hasta 512 GB — la configuración de 512 GB llega a finales de octubre de 2026, muy por encima de $10,000).
- Mac Studio ya no ofrece nivel M5 Pro — ahora empieza en M5 Max. El Mac mini es la nueva entrada al chip M5 Pro.
- El MacBook Pro 16" M5 Max (disponible desde marzo de 2026) tiene el mismo ancho de banda que el Mac Studio M5 Max: 460 GB/s (GPU 32 núcleos) y 614 GB/s (GPU 40 núcleos) en ambos formatos.
- Todas las configuraciones M5 Pro/Max: 307–614 GB/s de ancho de banda de memoria. El M5 Ultra alcanza hasta 1,2 TB/s.
- Operación silenciosa: los ventiladores del MacBook Pro se activan durante la inferencia; los del Mac Studio y Mac mini rara vez giran.
- MLX es el más rápido en M5. Ollama usa el backend MLX automáticamente en Apple Silicon.
- Memoria unificada: desde 24 GB (Mac mini M5 Pro base) hasta 512 GB (Mac Studio M5 Ultra) disponibles para cualquier modelo.
La actualización de Apple del 25 de agosto de 2026 llevó el M5 Pro al Mac mini ($1,699) por primera vez y confirmó el Mac Studio M5 Max ($2,499, hasta 128 GB) más un nuevo Mac Studio M5 Ultra ($5,499, hasta 512 GB) — todos disponibles el 22 de septiembre de 2026.
Los Mac con Apple Silicon usan memoria unificada — CPU, GPU y motor de IA comparten el mismo grupo de memoria rápida. Un M5 Max de 128 GB puede cargar un modelo 70B completo, y la nueva opción de 512 GB del M5 Ultra va aún más lejos.
🔄 Actualización 26 de agosto de 2026: la actualización de hardware de Apple del 25 de agosto de 2026 llevó un chip M5 Pro al Mac mini por primera vez (desde $1,699, hasta 64 GB) y confirmó el Mac Studio M5 Max (desde $2,499, hasta 128 GB) junto a un nuevo Mac Studio M5 Ultra (desde $5,499, hasta 512 GB — la configuración de 512 GB llega a finales de octubre de 2026). Mac Studio ya no incluye nivel M5 Pro. Todavía no existen benchmarks independientes de terceros para los nuevos Mac mini y Mac Studio; las cifras de tokens/seg de este artículo siguen basándose en pruebas del MacBook Pro 16" M5 Max (disponible desde marzo de 2026) salvo que se indique lo contrario.
Por qué importa Apple Silicon M5 para LLM local
Apple Silicon representa una arquitectura radicalmente diferente para cargas de trabajo de IA. Estas son las razones por las que importa para usuarios de LLM local.
- Arquitectura de memoria unificada: M5 Pro y M5 Max comparten un único pool de memoria rápida (24 GB hasta 128 GB) accesible simultáneamente por CPU, GPU y Neural Engine. Sin cuello de botella entre VRAM y RAM. Los modelos permanecen en memoria rápida y la inferencia se mantiene ágil.
- El ancho de banda de memoria como verdadero cuello de botella: La inferencia LLM moderna está limitada por la memoria, no por el cómputo. M5 Max a 460–614 GB/s compite directamente con RTX 4090 (1008 GB/s de ancho de banda VRAM) a pesar de la diferencia de capacidad (24 GB vs 128 GB). La memoria unificada aprovecha cada byte.
- Apple Fusion Architecture (nueva en M5): M5 Pro y M5 Max separan CPU y GPU en dies de 3 nm distintos dentro de un mismo paquete, permitiendo escalado independiente y optimización térmica. Este diseño modular mejora la eficiencia energética y reduce el calor residual frente a los diseños monolíticos.
- Neural Accelerator en cada núcleo GPU: Cada núcleo GPU incluye aceleradores neuronales dedicados para cargas de trabajo de IA, complementando el Neural Engine compartido. Esta arquitectura distribuida acelera operaciones ML en toda la GPU, no solo en núcleos especializados, mejorando los mecanismos de transformer y atención en la inferencia LLM.
- Mejora de rendimiento vs M4: Apple afirma hasta un 30% de mejora multihilo sobre M4 Pro y M4 Max. Las pruebas reales de inferencia LLM muestran mejoras de 2–3× gracias a las ganancias en ancho de banda de memoria y refinamientos arquitectónicos.
- Conectividad Thunderbolt 5 (M5 Pro/Max): M5 Pro y M5 Max incorporan Thunderbolt 5 con 80 Gbps de ancho de banda base (el doble que Thunderbolt 4). Permite almacenamiento externo de alta velocidad, soporte multi-monitor y expansión eGPU (cuando sea compatible con el software).
- Wi-Fi 7 y Bluetooth 6 mediante el chip Apple N1: Los sistemas M5 incluyen el nuevo chip inalámbrico N1 con soporte para Wi-Fi 7 (hasta 5,8 Gbps) y Bluetooth 6.0 para conectividad de baja latencia. Mejora la respuesta al usar clientes de inferencia remota o APIs de modelos en la nube.
- El framework MLX madura rápidamente: Metal Learning eXtended (MLX) de Apple ya soporta Llama 3.3, Qwen, Mistral y Gemma con kernels optimizados. Ollama (mayo 2026) detecta y usa MLX en Apple Silicon automáticamente sin configuración manual.
- La eficiencia energética es real: M5 Max estimado a 65–100 W bajo carga de inferencia completa. Un mes de inferencia continua (720 horas) cuesta $8–12 en electricidad en EE. UU. Una RTX 4090 a 350 W costaría $40–60 el mismo mes.
- Operación silenciosa: Los ventiladores del Mac Studio M5 están en 30 dB en reposo y rara vez superan los 40 dB bajo inferencia LLM intensa. El MacBook Pro permanece lo suficientemente fresco para usarse sobre el regazo.
- Mejor valor de reventa: Los Macs de segunda mano M1/M2/M3 conservan el 50–60% de su precio original 2–3 años después. Las RTX 4090 usadas caen al 40–50% por historial de minería y obsolescencia de versiones CUDA.
Tabla comparativa Apple Silicon M5
Todas las configuraciones siguientes son precios reales confirmados por Apple a partir del anuncio del 25 de agosto de 2026 — ninguna es proyectada. Mac mini, Mac Studio y MacBook Pro llegan el 22 de septiembre de 2026, salvo el Mac Studio M5 Ultra de 512 GB (finales de octubre de 2026, precio muy por encima de $10,000). Aún no existen benchmarks independientes de tokens/seg para los nuevos Mac mini y Mac Studio.
| Configuración | Chip | Núcleos GPU | Memoria | Ancho de banda | Precio | Ideal para |
|---|---|---|---|---|---|---|
| Mac mini M5 Pro 24 GB | M5 Pro | 16 | 24 GB unificada | 307 GB/s | $1,699 | M5 Pro más barato, 7B–13B |
| Mac mini M5 Pro 64 GB | M5 Pro | 20 | 64 GB unificada | 307 GB/s | $2,699 | Modelos 30B, 64 GB barato |
| Mac Studio M5 Max 36 GB | M5 Max | 32 | 36 GB unificada | 460 GB/s | $2,499 | Entrada de escritorio |
| Mac Studio M5 Max 128 GB | M5 Max | 40 | 128 GB unificada | 614 GB/s | $5,099 | 70B Q5, usuarios avanzados |
| Mac Studio M5 Ultra 96 GB | M5 Ultra | 64 | 96 GB unificada | Hasta 1,2 TB/s | $5,499 | Modelos locales más grandes |
| Mac Studio M5 Ultra 512 GB | M5 Ultra | 80 | 512 GB unificada | Hasta 1,2 TB/s | $10,000+ (est.) | Modelos masivos, finales oct. |
| MacBook Pro 16" M5 Max 64 GB | M5 Max | 32 | 64 GB unificada | 460 GB/s | $3,499 | Portátil, 70B Q4 |
| MacBook Pro 16" M5 Max 128 GB | M5 Max | 40 | 128 GB unificada | 614 GB/s | $4,499 | Portátil, 70B Q5 |

Mac mini M5 Pro: Nueva entrada económica para LLM local
El 25 de agosto de 2026, Apple llevó por primera vez un chip M5 Pro al Mac mini — antes solo estaba disponible en el MacBook Pro. Con $1,699–$2,699 y 24–64 GB de memoria unificada, el Mac mini M5 Pro es ahora la forma más barata de alcanzar el límite de 64 GB del M5 Pro, superando tanto al MacBook Pro M5 Pro como a la idea descartada de un Mac Studio M5 Pro (Mac Studio ahora empieza en M5 Max). Disponible el 22 de septiembre de 2026.
- CPU: 15 o 18 núcleos M5 Pro
- GPU: GPU M5 Pro de 16 o 20 núcleos
- Memoria: 24 GB base, configurable a 48 GB o 64 GB DDR5 unificada
- Ancho de banda de memoria: 307 GB/s (idéntico al M5 Pro del MacBook Pro)
- Almacenamiento: SSD de 512 GB–2 TB (configurable)
- Puertos: Thunderbolt 5 (nuevo en Mac mini)
- Conectividad: Wi-Fi 7, Bluetooth 6
- Precio: $1,699 (16 núcleos GPU, 24 GB); $1,899 (20 núcleos GPU, 24 GB); +$1,000 para llegar a 64 GB
- Disponible: 22 de septiembre de 2026
Mac Studio M5 Max 36 GB: Configuración base
Confirmado el 25 de agosto de 2026: el Mac Studio M5 Max base cuesta $2,499 con GPU de 32 núcleos y 36 GB de memoria unificada fija (este nivel de GPU no permite ampliar memoria; para más RAM hay que subir al nivel de 40 núcleos). Disponible el 22 de septiembre de 2026. Mac Studio ya no ofrece nivel M5 Pro — este es ahora el Mac Studio más barato.
- CPU: 18 núcleos M5 Max
- GPU: GPU M5 Max de 32 núcleos
- Memoria: 36 GB unificada (fija en este nivel)
- Ancho de banda de memoria: 460 GB/s (idéntico al M5 Max de 32 núcleos en MacBook Pro)
- Almacenamiento: SSD de 512 GB–8 TB (configurable)
- Puertos: Thunderbolt 5
- Precio: $2,499
- Disponible: 22 de septiembre de 2026
Mac Studio M5 Max 48–128 GB: Mejor relación calidad-precio para LLM local
Confirmado el 25 de agosto de 2026: el Mac Studio M5 Max con GPU de 40 núcleos parte de $3,099 (48 GB) y llega a $5,099 configurado a 128 GB. Este es el nivel que realmente ofrece el mejor valor para 70B; la configuración de 64 GB está disponible por $3,499 dentro de este nivel. Disponible el 22 de septiembre de 2026.
- CPU: 18 núcleos M5 Max
- GPU: GPU M5 Max de 40 núcleos
- Memoria: 48 GB base, configurable a 64 GB o 128 GB DDR5 unificada
- Ancho de banda de memoria: 614 GB/s (idéntico al M5 Max de 40 núcleos en MacBook Pro)
- Almacenamiento: SSD de 512 GB–8 TB
- Puertos: Thunderbolt 5
- Precio: $3,099 (48 GB); $3,499 (64 GB); $5,099 (128 GB)
- Disponible: 22 de septiembre de 2026
Mac Studio M5 Ultra: Nuevo nivel de máximo rendimiento
Nuevo desde el 25 de agosto de 2026: Mac Studio M5 Ultra es un nuevo nivel por encima de M5 Max, desde $5,499 con 96 GB y escalable hasta 512 GB. La configuración de 512 GB llega a finales de octubre de 2026 y se espera muy por encima de $10,000. Es el primer Mac con M5 Ultra y el primer Mac con 512 GB de memoria unificada.
- CPU: Hasta 36 núcleos M5 Ultra
- GPU: Hasta 80 núcleos M5 Ultra
- Memoria: 96 GB base, configurable a 256 GB ya, 512 GB a finales de octubre de 2026
- Ancho de banda de memoria: Hasta 1,2 TB/s
- Almacenamiento: SSD de 1 TB–16 TB
- Puertos: Thunderbolt 5
- Precio: $5,499 (96 GB); 512 GB se espera muy por encima de $10,000
- Disponible: 22 de septiembre de 2026 (96–256 GB); finales de octubre de 2026 (512 GB)
MacBook Pro 16" M5 Max: LLM local en formato portátil
MacBook Pro 16" M5 Max ($3,499–$4,499) ofrece el mismo cómputo que Mac Studio M5 Max en un factor de forma portátil. El ancho de banda de memoria es idéntico entre ambos formatos — 460 GB/s en el nivel de 32 núcleos y 614 GB/s en el de 40 núcleos, tanto en MacBook Pro como en Mac Studio. El riesgo de throttle térmico bajo inferencia sostenida es el sacrificio por la portabilidad, no el ancho de banda.
- CPU: 18 núcleos M5 Max (6 super + 12 núcleos de rendimiento)
- GPU: GPU M5 Max de 32 o 40 núcleos
- Memoria: 64 GB o 128 GB de memoria unificada
- Pantalla: 16,2 pulgadas Liquid Retina XDR, 3456×2234
- Ancho de banda de memoria: 460 GB/s (64 GB) o 614 GB/s (128 GB)
- Almacenamiento: SSD de 512 GB–8 TB
- Batería: 72,4 Wh de litio-polímero (hasta 20 horas de reproducción de video; menos bajo inferencia)
- Peso: 2,14 kg
- Puertos: 3× Thunderbolt 4, HDMI 2.1, ranura SD, conector de auriculares
- Precio: $3,499 (64 GB, GPU de 32 núcleos) a $4,499 (128 GB, GPU de 40 núcleos). Los precios pueden variar según tu país.
🏆 Nuestras recomendaciones: qué Mac comprar para LLM local
Simplifica la elección con estas recomendaciones claras según caso de uso.
- 🏆 💰 M5 PRO MÁS BARATO: Mac mini M5 Pro ($1,699, llega 22 sept. 2026) • Por qué: primer Mac mini con M5 Pro. Supera cualquier forma anterior de conseguir M5 Pro. 24 GB base sirve para 7B–13B; configura a 64 GB para 30B. • Para quién: compradores con presupuesto ajustado que se inician en Apple Silicon. • Reservar en Apple Store →
- 🥇 MEJOR VALOR PARA 70B: Mac Studio M5 Max 64 GB ($3,499, llega 22 sept. 2026) • Por qué: ejecuta Llama 3.3 70B Q4 cómodamente. Mismo silicio de 614 GB/s que MacBook Pro, sin throttle térmico gracias a la refrigeración de escritorio. • Para quién: desarrolladores que estandarizan un flujo de trabajo 70B sin necesidad de portabilidad. • Reservar en Apple Store →
- 🔥 MÁXIMO RENDIMIENTO: Mac Studio M5 Ultra 96 GB ($5,499, llega 22 sept. 2026) • Por qué: nuevo nivel superior. Hasta 1,2 TB/s de ancho de banda — casi el doble que M5 Max. La configuración de 512 GB llega a finales de octubre de 2026. • Estado: chip completamente nuevo — sin benchmarks independientes todavía. • Reservar en Apple Store →
- **💼 MEJOR OPCIÓN PORTÁTIL: MacBook Pro 16" M5 Max 64 GB ($3,499) [Disponible ahora]** • Por qué: GPU y ancho de banda idénticos al Mac Studio M5 Max 64 GB. Portátil con pantalla Liquid Retina XDR. Acepta 10–15% de pérdida de rendimiento por throttle térmico — el ancho de banda en sí no es menor. • Alternativa: Mac Studio M5 Max 64 GB ($3,499, 22 sept. 2026) al mismo precio con mejor refrigeración sostenida si no necesitas portabilidad. • Comprar en Apple Store →
Benchmarks de rendimiento LLM local (MacBook Pro M5 Pro/M5 Max, verificados)
Los siguientes benchmarks reflejan pruebas en MacBook Pro 16" M5 Pro y M5 Max (disponible desde marzo de 2026) junto con cifras declaradas por el fabricante. El Mac mini M5 Pro, el Mac Studio M5 Max y el Mac Studio M5 Ultra llegan el 22 de septiembre de 2026 (M5 Ultra 512 GB a finales de octubre de 2026) y aún no tienen benchmarks independientes publicados. Como M5 Pro y M5 Max son el mismo silicio en todos los formatos, estas cifras son un buen indicador, pero no mediciones tomadas en esas máquinas específicas; las cifras de M5 Ultra son totalmente no verificadas ya que ese chip nunca se ha lanzado antes. Todas las pruebas: tamaño de lote 1, 2048 tokens de contexto, últimas cuantizaciones de modelos.
- ## Llama 3.1 8B (Q4_K_M) • M5 Pro 32 GB: 25–30 tokens/seg • M5 Pro 64 GB: 35–45 tokens/seg • M5 Max 64 GB: 50–65 tokens/seg • M5 Max 128 GB: 60–75 tokens/seg • Referencia (RTX 4090): 90–120 tokens/seg
- ## Llama 3.3 70B (Q4_K_M) • M5 Pro 32 GB: RAM insuficiente • M5 Pro 64 GB: 4–6 tokens/seg • M5 Max 64 GB: 8–12 tokens/seg • M5 Max 128 GB: 12–18 tokens/seg • Referencia (RTX 4090): 6–10 tokens/seg (offloaded)
- ## Llama 3.3 70B (Q5_K_M) • M5 Pro 64 GB: RAM insuficiente • M5 Max 64 GB: RAM insuficiente • M5 Max 128 GB: 8–12 tokens/seg • Referencia (RTX 4090): no posible (límite VRAM)
- ## Llama 3.3 70B (Q8_0) • M5 Max 128 GB: 8–12 tokens/seg • RTX 4090: no posible (requiere offload multi-GPU)
- ## Qwen 3 32B (Q4_K_M) • M5 Pro 64 GB: 15–22 tokens/seg • M5 Max 64 GB: 20–28 tokens/seg • M5 Max 128 GB: 22–30 tokens/seg
- ## Mistral Small 24B (Q4_K_M) • M5 Pro 64 GB: 20–28 tokens/seg • M5 Max 64 GB: 25–35 tokens/seg • M5 Max 128 GB: 28–38 tokens/seg
- ## Metodología Todos los benchmarks mediante Ollama con backend MLX (predeterminado desde mayo de 2026). Las pruebas miden procesamiento de prompt + generación de tokens en la familia Apple Silicon M5. Throttle térmico en MacBook Pro después de 3+ horas de carga sostenida. Mac Studio mantiene rendimiento consistente en ejecuciones de 24+ horas. Los números varían 10–15% según temperatura, procesos en segundo plano y versión exacta de cuantización del modelo.
Apple Silicon M5 vs workstation PC para LLM local
Apple Silicon y NVIDIA son filosofías diferentes. Esta es la comparativa honesta.
- ## Mac Studio M5 Max 128 GB gana en: • Memoria unificada: 128 GB disponibles para cualquier modelo, sin límite de VRAM • Eficiencia energética: 100 W vs 600 W+ para un PC equivalente • Operación silenciosa: 40 dB bajo carga completa • Ecosistema macOS: integración con MLX, Metal y Core ML • Costo total de propiedad: menor gasto en electricidad en 3 años • Construcción premium: sin ruido de ventiladores, excelente gestión térmica
- ## Workstation PC (RTX 5090) gana en: • Velocidad bruta en modelos 7B–13B: 90–120 tokens/seg vs 60–75 del M5 Max • Amplitud del ecosistema CUDA: más modelos, herramientas y código de investigación • Fine-tuning: PyTorch + CUDA domina frente a MLX • Flexibilidad de actualización: intercambia GPUs, añade más VRAM • Precio en niveles bajos: una RTX 4070 Ti de $800–1,200 supera al M5 Pro • IA no-LLM: Stable Diffusion, entrenamiento, multimodal son más rápidos en NVIDIA
- ## El veredicto honesto Para inferencia LLM pura con modelos de 30B–70B, Mac Studio M5 Max 128 GB ($5,099) compite directamente con builds PC de $4,500+, y Mac Studio M5 Ultra eleva el techo a modelos que necesitan 256 GB o 512 GB. La ventaja de la memoria unificada es real y medible. Para inferencia de 7B–13B, un PC de $1,500 con RTX 4070 Ti supera al Mac mini M5 Pro en velocidad bruta. La ventaja de Apple se reduce con modelos más pequeños. Para fine-tuning, entrenamiento, Stable Diffusion a escala o PyTorch en producción, PC + NVIDIA gana. MLX está mejorando, pero aún existen diferencias.

MLX vs Ollama vs llama.cpp en Apple Silicon
Tres motores de inferencia principales funcionan en M5. ¿Cuál es el adecuado para ti?
- ## MLX (nativo de Apple) • Rendimiento: tokens/seg más rápidos en M5. Optimización Metal nativa. • Soporte de modelos: en crecimiento (Llama, Qwen, Mistral, Gemma disponibles) • Configuración: centrado en Python, requiere familiaridad con la línea de comandos • Ideal para: usuarios avanzados que buscan máximo rendimiento • Desventaja: menos fácil de usar que Ollama
- ## Ollama (multiplataforma, mayo 2026 + backend MLX) • Rendimiento: usa MLX automáticamente en Apple Silicon (solo 5–10% más lento que MLX puro) • Soporte de modelos: la mayor biblioteca de modelos. Nuevos modelos añadidos cada semana. • Configuración: instalación con un solo comando, funciona desde el primer momento • Ideal para: principiantes y la mayoría de desarrolladores. REST API para integración. • Desventaja: 5–10% de sobrecarga de rendimiento vs MLX puro
- ## llama.cpp (multiplataforma, control de menor nivel) • Rendimiento: competitivo con Ollama/MLX cuando está optimizado • Personalización: mayor control sobre cuantización y parámetros de inferencia • Configuración: requiere compilación y conocimientos de línea de comandos • Ideal para: investigadores, flujos de trabajo de cuantización personalizada • Desventaja: curva de aprendizaje más pronunciada que Ollama
- ## Recomendación por tipo de usuario • Principiantes: Ollama (funciona de inmediato, documentación extensa) • Desarrolladores: REST API de Ollama (fácil de integrar en aplicaciones) • Usuarios avanzados: MLX directamente (máximo rendimiento) • Investigadores: llama.cpp (máxima personalización)
Configuración rápida en macOS (10 pasos)
El camino más rápido para ejecutar tu primer LLM local de 70B en Apple Silicon.
- 1Compra tu Mac
Why it matters: Elige entre Mac Studio M5 Max o MacBook Pro 16" M5 Max según tus necesidades de portabilidad. - 2Configuración inicial de macOS
Why it matters: Usa el Asistente de Migración (transfiere desde tu Mac antiguo) o instalación limpia. Se recomienda macOS Sonoma 15.2+. - 3Instala Homebrew
Why it matters: /bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)" — gestor de paquetes para todo lo demás. - 4Instala Ollama
Why it matters: brew install ollama — instalación sencilla con un solo comando. - 5Inicia el servicio Ollama
Why it matters: ollama serve (se ejecuta en primer plano) o usa Ollama.app desde la carpeta Aplicaciones. - 6Descarga el primer modelo de prueba
Why it matters: ollama pull llama3.1:8b — verifica la instalación con un modelo pequeño (descarga ~4 GB). - 7Prueba la inferencia básica
Why it matters: ollama run llama3.1:8b "Explica los LLMs locales en una frase" — debería responder en 15–30 segundos. - 8Descarga el modelo grande objetivo
Why it matters: ollama pull llama3.1:70b-instruct-q4_K_M (descarga ~35 GB). Tarda 20–40 min con conexión rápida. - 9Monitoriza el rendimiento
Why it matters: asitop muestra el uso de recursos de Apple Silicon. Ábrelo en un segundo terminal: brew install asitop && asitop. - 10Opcional: instala LM Studio para una interfaz gráfica
Why it matters: Descarga desde lmstudio.ai. Más fácil que la línea de comandos para quienes no son desarrolladores. Compatible completamente con la aceleración MLX del M5.
Cómo acelerar Ollama en Apple Silicon M5
La mayoría de las instalaciones de Ollama en Apple Silicon ya usan la ruta rápida por defecto, así que esta lista trata de eliminar lo que lo ralentiza en silencio, no de ajustes exóticos.
Confirma que Ollama usa el backend MLX/Metal con `ollama ps`, reduce el contexto y la cuantización si no necesitas la máxima precisión, cierra apps que consuman mucha memoria y mantén el MacBook Pro conectado a la corriente y elevado en sesiones largas.
Ollama ya suele ir rápido por defecto en un Mac M5 — la mayoría de los problemas de velocidad vienen de otra cosa consumiendo tu memoria unificada o de un portátil calentándose, no de un ajuste que olvidaste activar.
- Confirma que el modelo realmente se ejecuta en Metal/MLX y no cae a CPU. Ejecuta `ollama ps` con un modelo cargado — debería mostrar el modelo completo en GPU. Ollama usa automáticamente el backend MLX en Apple Silicon desde mayo de 2026; una caída parcial a CPU suele significar que el modelo no cabe en tu memoria unificada libre, no que falte un ajuste.
- Libera memoria unificada antes de una sesión larga. La memoria unificada se comparte entre macOS y el modelo — un navegador con muchas pestañas, Docker Desktop o Xcode en segundo plano pueden quitar varios GB a lo que Ollama puede cargar en GPU. Ciérralos antes de cargar un modelo grande y comprueba la memoria disponible con el Monitor de Actividad o `asitop`.
- Reduce la ventana de contexto si no la necesitas. El `num_ctx` por defecto de Ollama reserva memoria y cómputo para todo el contexto, lo uses o no. Configura un `num_ctx` más pequeño en el Modelfile o en la petición a la API (por ejemplo 4096 en lugar de 32K) para chats cortos — reduce la presión de memoria de la caché KV y acelera la generación.
- Ajusta la cuantización a tu necesidad real de calidad. Q4_K_M es notablemente más rápido que Q8_0 o Q5_K_M con un coste de calidad pequeño y normalmente aceptable (ver la guía de cuantización). Si un modelo va más lento que los benchmarks anteriores, prueba con la variante Q4 antes de asumir que el hardware es el cuello de botella.
- Mantén el MacBook Pro conectado a la corriente y elevado en sesiones largas. Como se indica en los benchmarks anteriores, el MacBook Pro pierde un 10-15% de rendimiento tras 2-3 horas de carga continua por el calor acumulado en un chasis más delgado. Un soporte que mejore la ventilación, y usar corriente alterna en vez de batería, retrasa este efecto. Para sesiones de varias horas, la refrigeración del Mac Studio mantiene el rendimiento completo donde un MacBook Pro no lo hace.
- Actualiza macOS y Ollama. Apple incluye mejoras de rendimiento de Metal en versiones puntuales, y Ollama publica con regularidad versiones más rápidas del backend MLX/llama.cpp. Usar una versión antigua de macOS u Ollama en silicio M5 nuevo puede dejar rendimiento real sobre la mesa sin ningún motivo salvo no haber actualizado.
- Evita ejecutar varios modelos a la vez si no lo necesitas. Cada modelo cargado reserva su propia parte de memoria unificada. `OLLAMA_MAX_LOADED_MODELS` controla cuántos modelos mantiene Ollama residentes a la vez — el valor por defecto permite más de uno, lo cual es cómodo pero reparte tu ancho de banda de memoria disponible entre modelos si consultas más de uno a la vez.
# Comprobar si un modelo está totalmente en GPU
ollama ps
# Ejecutar con una ventana de contexto más pequeña (más rápido, menos presión de memoria)
ollama run llama3.1:8b --verbose
# o configúralo en un Modelfile: PARAMETER num_ctx 4096
# Limitar Ollama a un solo modelo residente a la vez
OLLAMA_MAX_LOADED_MODELS=1 ollama serveMatriz de decisión: qué configuración de Mac comprar
Usa esta matriz para encontrar la mejor opción según tu caso de uso.
- 1. El presupuesto es lo primero, modelos pequeños (7–13B): Mac mini M5 Pro 24 GB ($1,699) — M5 Pro más barato
- 2. Modelos de 30B en escritorio económico: Mac mini M5 Pro 64 GB ($2,699)
- 3. Quiero ejecutar modelos 70B cómodamente: Mac Studio M5 Max 64 GB ($3,499)
- 4. Necesito 70B Q5 con ventanas de contexto de 32K+: Mac Studio M5 Max 128 GB ($5,099)
- 5. Necesito 256–512 GB para los modelos locales más grandes: Mac Studio M5 Ultra ($5,499–$10,000+)
- 6. LLM local portátil, dispuesto a aceptar throttle térmico: MacBook Pro 16" M5 Max 64 GB ($3,499)
- 7. Ya estoy en el ecosistema macOS (Xcode, Final Cut Pro): cualquier variante de Mac Studio M5
- 8. Investigación/fine-tuning con experimentos MLX: Mac Studio M5 Max 128 GB o M5 Ultra
- 9. Quiero máximo silencio y operación en reposo: Mac Studio (ventiladores rara vez giran)
- 10. Presupuesto de $4,000+, quiero portabilidad: MacBook Pro 16" M5 Max 128 GB ($4,499)
- 11. Considerando alternativas: PC RTX 4090 ($3,000+) o mini PC AMD Ryzen AI Max+ ($1,600–2,000)
Cuándo Apple Silicon M5 no es la opción adecuada para LLM local
Apple Silicon es excelente, pero no es universal. Evita Mac para LLM local en estos escenarios.
- Necesitas flujos de trabajo exclusivos de CUDA: la mayoría de la inferencia LLM funciona en Apple Silicon, pero el fine-tuning con torch.cuda, los kernels CUDA de vLLM y el código de investigación CUDA propietario no se ejecutan en MLX. Si el 70% de tu trabajo es específico de CUDA, opta por una GPU RTX.
- Haces trabajo intensivo con Stable Diffusion: los modelos de difusión se ejecutan 2–3× más lento en M5 que en RTX 4090. Si la generación de imágenes representa el 30%+ de tu flujo de trabajo, PC + RTX es la mejor opción.
- El presupuesto es la prioridad absoluta: un PC de $1,500 con RTX 4070 Ti supera al Mac mini M5 Pro en velocidad de inferencia para modelos 7B–13B. Si solo importa el presupuesto, el PC es más barato.
- Necesitas capacidad de actualización en una workstation: la RAM y el almacenamiento del Mac Studio son fijos en el momento de la compra. Los PCs permiten actualizaciones incrementales. Para un uso de 5+ años, el PC puede ser más económico a largo plazo.
- Exiges tokens/seg en triple dígito: RTX 4090 alcanza 90–120 tokens/seg en Llama 8B. M5 Max llega a 60–75. Para inferencia de alto rendimiento (atendiendo a múltiples usuarios), NVIDIA sigue ganando.
- No usas macOS habitualmente: cambiar de ecosistema desde Windows/Linux únicamente por LLM local no merece la pena, a menos que también quieras macOS por otras razones.
- Necesitas inferencia de producción 24/7: Mac Studio es excelente pero está diseñado para picos de carga. Para inferencia continua con SLA, las workstations NVIDIA empresariales son una apuesta más segura.
Preguntas frecuentes
¿Cómo hago que Ollama vaya más rápido en un MacBook Pro M5?
Confirma que el modelo se ejecuta en Metal/MLX con `ollama ps`, cierra apps en segundo plano que consuman mucha memoria para liberar memoria unificada, reduce `num_ctx` si no necesitas una ventana de contexto larga, usa cuantización Q4_K_M en lugar de Q5/Q8, y mantén el MacBook Pro conectado a la corriente y elevado en sesiones de más de 2-3 horas para retrasar la pérdida de rendimiento por calor. Consulta la sección de optimización de velocidad más arriba para la lista completa.
¿Puede Mac Studio M5 Max ejecutar Llama 3.3 70B?
Sí, todas las configuraciones M5 Max pueden. 64 GB ejecuta 70B Q4 a 8–12 tokens/seg. 128 GB ejecuta 70B Q5 a 8–12 tokens/seg (mayor calidad, misma velocidad).
¿Cómo se compara M5 Max con RTX 4090 para LLM local?
M5 Max es más lento en modelos pequeños (60–75 vs 90–120 tokens/seg para Llama 8B). Competitivo en modelos grandes (8–12 vs 6–10 tokens/seg para Llama 70B). M5 Max consume 1/3 de la energía.
¿Son suficientes 64 GB de RAM o necesito 128 GB?
Para un único modelo 70B Q4: 64 GB es suficiente. Para 70B Q5, múltiples modelos concurrentes o fine-tuning: se recomienda 128 GB.
¿Cuál es la diferencia entre M5 Pro y M5 Max para LLM?
M5 Pro tiene GPU de 16/20 núcleos, 307 GB/s, hasta 64 GB. M5 Max tiene GPU de 32/40 núcleos, 460/614 GB/s, hasta 128 GB. M5 Max es 30–50% más rápido en el mismo nivel de memoria. M5 Ultra (solo Mac Studio) llega más lejos: hasta 80 núcleos, hasta 1,2 TB/s, hasta 512 GB.
¿El MacBook Pro sufre throttle térmico durante la inferencia LLM sostenida?
Sí, después de 2–3 horas de inferencia continua, el MacBook Pro reduce el rendimiento un 10–15%. Mac Studio mantiene el rendimiento completo las 24 horas del día.
¿Puedo ejecutar Stable Diffusion en Apple Silicon?
Sí, Stable Diffusion XL se ejecuta en M5 a 8–12 seg/imagen (lento vs RTX 4070 ~3 seg). MLX lo soporta de forma nativa.
¿Es MLX más rápido que Ollama en Mac?
MLX es 5–10% más rápido en rendimiento de tokens bruto. Ollama es más conveniente y pierde solo un rendimiento menor. Elige según el flujo de trabajo, no por la diferencia de velocidad bruta.
¿Cuánta electricidad consume Mac Studio M5 para inferencia LLM?
Mac Studio M5 Max: 70–100 W sostenido. Un mes de inferencia 24/7 (720 horas) ≈ 60 kWh ≈ $8–12 de electricidad en EE. UU. Una RTX 4090 costaría $40–60 el mismo mes.
¿Tiene el Mac mini M5 Pro ahora?
Sí, confirmado el 25 de agosto de 2026. El Mac mini M5 Pro parte de $1,699 (24 GB, hasta 64 GB), 307 GB/s, Thunderbolt 5. Llega el 22 de septiembre de 2026 — el Mac con M5 Pro más barato jamás ofrecido.
¿El Mac Studio sigue teniendo una configuración M5 Pro?
No. Desde la actualización del 25 de agosto de 2026, Mac Studio empieza en M5 Max ($2,499). El Mac mini es ahora la entrada al chip M5 Pro.
¿Qué es el Mac Studio M5 Ultra y cuánta memoria soporta?
M5 Ultra es un nuevo chip por encima de M5 Max, exclusivo de Mac Studio, desde $5,499 (96 GB). Escala a 256 GB ya y 512 GB a finales de octubre de 2026 (se espera muy por encima de $10,000), con hasta 1,2 TB/s.
¿Puedo hacer fine-tuning de modelos en Apple Silicon?
Sí, el fine-tuning LoRA funciona bien. El fine-tuning de pesos completos es más lento que con GPU de escritorio (aún no hay soporte de entrenamiento distribuido).
¿Apple Silicon es bueno para inferencia pero malo para entrenamiento?
En parte. La inferencia es excelente. El entrenamiento/fine-tuning funciona, pero es más lento que NVIDIA. El framework MLX está mejorando rápidamente.
¿Cómo ayuda el Neural Engine con LLM?
El Neural Engine (8 TOPS, 16 núcleos) acelera las operaciones cuantizadas (INT8, Q4). Beneficio medible (~10%) para modelos Q4_K_M.
¿Puedo ejecutar varios modelos simultáneamente en M5 Max 128 GB?
Sí. 128 GB permiten dos modelos de 32B o uno de 70B más uno de 13B ejecutándose de forma concurrente a velocidad decente.
¿Cuál es el tiempo típico de configuración para LLM local en Mac?
15–30 minutos desde un Mac nuevo hasta el primer modelo 70B ejecutándose mediante Ollama (incluyendo 20–40 min de descarga del modelo con buena conexión).
¿Apple Silicon funciona con todos los modelos más recientes (Llama 4, Qwen 3, etc.)?
A fecha de agosto de 2026: Llama 3.3 ✓, Qwen 3 ✓, Mistral ✓, Gemma ✓, DeepSeek ✓. El soporte MLX se amplía semanalmente. Consulta el GitHub de MLX para la lista actualizada.
¿Debo comprar Mac mini M6 o Mac mini M5 Pro para LLM local?
M6 es de gama básica ($899, hasta 32 GB, 170 GB/s) y no está pensado para LLM local más allá de modelos pequeños. M5 Pro ($1,699, hasta 64 GB, 307 GB/s) es la opción para LLM local.
¿Vale la pena considerar un Mac Studio reacondicionado?
Sí. Los productos Apple reacondicionados incluyen garantía de 1 año y conservan el 90–95% de su valor original. Ahorra un 10–15%.
