Skip to main content
PromptQuorum
Home/Local LLMs/Mac Mini M6 como servidor de IA local: LLM, Whisper, RAG y asistente de voz 24/7
Hardware & Performance

Mac Mini M6 como servidor de IA local: LLM, Whisper, RAG y asistente de voz 24/7

·12 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

El Mac Mini M5 Pro 64 GB (desde $1.699, disponible el 22 de septiembre de 2026) es la mejor opción como servidor de IA siempre activo: silencioso (casi sin ventilador), 25–55 W de consumo, $26–39/año estimados en electricidad. Su límite de 64 GB de memoria unificada es lo que permite ejecutar modelos Ollama 34B, Whisper STT, pipeline RAG y asistente de voz simultáneamente — el Mac Mini M6 base (desde $899) tiene un límite de 32 GB, insuficiente para los cuatro servicios a la vez. Apple aún no ha lanzado este hardware, así que las cifras de consumo y temperatura de abajo son estimaciones, no benchmarks medidos por PromptQuorum.

Apple presentó el nuevo Mac Mini el 25 de agosto de 2026: el chip M6 (desde $899, hasta 32 GB de memoria unificada) y el chip M5 Pro (desde $1.699, hasta 64 GB de memoria unificada). Ambos salen a la venta el 22 de septiembre de 2026. Cualquiera de las dos configuraciones es una excelente opción como servidor de IA local silencioso y siempre activo. Esta guía repasa la configuración de hardware, la estrategia de instalación y el análisis coste-beneficio para ejecutar Ollama LLM, Whisper STT, pipeline RAG y una pila de asistente de voz. Coste eléctrico estimado: $26–39 al año.

Mac Mini M6 como servidor de IA local: LLM, Whisper, RAG y asistente de voz 24/7

Por qué el nuevo Mac Mini (M6/M5 Pro) es un servidor de IA ideal

Apple presentó el nuevo Mac Mini el 25 de agosto de 2026: el M6 (desde $899, hasta 32 GB de memoria unificada) y el M5 Pro (desde $1.699, hasta 64 GB de memoria unificada). Ambos salen a la venta el 22 de septiembre de 2026. Para un servidor de IA local silencioso y siempre activo, la configuración de 64 GB del M5 Pro es la mejor opción: silencio casi total (base sin ventilador, Pro con ventilador a muy bajas RPM), bajo consumo eléctrico (25–55 W frente a 300 W+ de los PC con GPU) y suficiente memoria unificada para ejecutar un modelo de 34B parámetros junto con Whisper, RAG y un asistente de voz simultáneamente.

El coste eléctrico anual estimado es de $26–39 frente a $263–394 de los equivalentes con GPU de escritorio — menos de dos meses de una sola suscripción a ChatGPT Plus, cada año. Como el hardware no sale a la venta hasta el 22 de septiembre de 2026, todavía no existen benchmarks independientes; las cifras de consumo y rendimiento de esta guía son estimaciones basadas en las especificaciones publicadas por Apple y en generaciones anteriores del Mac Mini con Apple Silicon, no resultados medidos por PromptQuorum.

PropiedadMac Mini M5 ProDesktop + RTX 4070Raspberry Pi 5
Coste de hardwareDesde $1.699$1.200+$80
Consumo (reposo)8 W (estimado)50 W5 W
Consumo (carga LLM)25–55 W (estimado)200–300 WN/A (demasiado pequeño)
Electricidad anual$26–39 (estimado)$263–394~$5
Nivel de ruidoCasi silenciosoRuidoso (3+ ventiladores)Silencioso
Tamaño máximo de modelo34B (Q5)8B (12 GB VRAM)Solo 1–3B
Fiabilidad siempre activoExcelenteBuenaExcelente
Huella física13×13 cmTorre completa8×8 cm

Recomendación de configuración de hardware

El M5 Pro con 64 GB (desde $1.699) es la configuración que hay que comprar para una pila completa de servidor de IA siempre activo: ejecuta modelos de 34B, soporta los cuatro servicios simultáneos de esta guía (LLM + Whisper + RAG + asistente de voz) y tiene margen para 2–3 años de crecimiento en el tamaño de los modelos. El M6 base tiene un límite de 32 GB de memoria unificada — suficiente para un LLM más un servicio ligero, pero no para los cuatro a la vez. Nunca compres el nivel M6 con límite de 32 GB si planeas ejecutar la pila completa.

ConfiguraciónPrecio (2026)Memoria máximaIdeal paraModelos compatibles
Mac Mini M6 (base)Desde $899Hasta 32 GBUn LLM + un servicio ligero7B–13B Q4
Mac Mini M5 Pro ★Desde $1.699Hasta 64 GBPila completa siempre activa (LLM+Whisper+RAG+voz)Modelos 34B con comodidad

★ Recomendado para este uso. El límite de 64 GB es el factor decisivo: ejecutar LLM, Whisper STT, pipeline RAG y asistente de voz simultáneamente requiere que los cuatro modelos residan en memoria a la vez, algo que el M6 con su límite de 32 GB no puede ofrecer. Planificación de almacenamiento: Llama 3.1 8B Q4 ~5 GB por modelo, Whisper large-v3 ~3 GB, modelo de embeddings ~0,5 GB, ChromaDB con 10.000 documentos ~2 GB. Configuración típica de 5 modelos: 50–80 GB. Mínimo 512 GB SSD; 1 TB para usuarios avanzados. Apple todavía no ha publicado precios para las configuraciones de memoria por encima de la base — consulta apple.com para el precio exacto configurado.

Límite de memoria del Mac Mini M6 (32 GB máx.) frente al M5 Pro (64 GB máx.) en relación con la capacidad máxima de modelo: el M6 de 32 GB es adecuado para un LLM más un servicio ligero, mientras que el M5 Pro de 64 GB ejecuta cómodamente un modelo 34B junto con Whisper, RAG y asistente de voz simultáneamente.
Límite de memoria del Mac Mini M6 (32 GB máx.) frente al M5 Pro (64 GB máx.) en relación con la capacidad máxima de modelo: el M6 de 32 GB es adecuado para un LLM más un servicio ligero, mientras que el M5 Pro de 64 GB ejecuta cómodamente un modelo 34B junto con Whisper, RAG y asistente de voz simultáneamente.

Configuración completa del servidor (30 minutos desde el desembalaje hasta el funcionamiento)

Estos pasos configuran el Mac Mini M6 o M5 Pro como un servidor de IA persistente y accesible en red. Tras completar todos los pasos, cualquier dispositivo de tu LAN puede enviar solicitudes a la API de Ollama del Mac Mini en el puerto 11434.

Paso 1: Instalar Homebrew y Ollama

bash
# Install Homebrew (if not already installed)
/bin/bash -c "$(curl -fsSL https://raw.githubusercontent.com/Homebrew/install/HEAD/install.sh)"

# Install Ollama
brew install ollama

# Start as background service (auto-starts on reboot)
brew services start ollama

# Verify it's running
curl http://localhost:11434/api/version

Paso 2: Configurar el acceso en red

Por defecto, Ollama solo escucha en localhost. Estos ajustes lo abren a tu LAN y configuran el caché multi-modelo.

bash
# Allow Ollama to listen on all interfaces (not just localhost)
echo 'export OLLAMA_HOST=0.0.0.0:11434' >> ~/.zshrc
echo 'export OLLAMA_MAX_LOADED_MODELS=3' >> ~/.zshrc
echo 'export OLLAMA_KEEP_ALIVE=1h' >> ~/.zshrc
source ~/.zshrc

# Restart Ollama with new settings
brew services restart ollama

# Verify listening on all interfaces
lsof -i :11434

Paso 3: Configurar el firewall de macOS

Ajustes del Sistema → Red → Firewall → Opciones → Añadir la ruta del binario de Ollama (/opt/homebrew/bin/ollama) → Permitir conexiones entrantes. Esto permite que los dispositivos de la LAN accedan al puerto 11434 con el firewall activo.

Paso 4: Descargar los modelos recomendados

bash
# General-purpose LLM
ollama pull llama3.1:8b

# Alternative: faster, similar quality
ollama pull mistral:7b

# For coding tasks
ollama pull deepseek-coder-v2:16b

# Embedding model for RAG
ollama pull nomic-embed-text

Paso 5: Configurar IP estática o mDNS

mDNS (Bonjour) es la opción más sencilla — tu Mac Mini es accesible por nombre de host en tu red local sin ninguna configuración adicional.

bash
# Find current local IP
ipconfig getifaddr en0

# Or use Bonjour - access at hostname.local
scutil --get LocalHostName
# Ejemplo: macmini → accesible en http://macmini.local:11434

Paso 6: Evitar el modo de reposo (imprescindible para siempre activo)

Sin estos ajustes, macOS entrará en reposo tras la inactividad, dejando el servidor inaccesible hasta que se reactive manualmente.

bash
sudo pmset -a sleep 0
sudo pmset -a displaysleep 1
sudo pmset -a powernap 0
sudo pmset -a hibernatemode 0

# Verify settings
pmset -g

Paso 7: Probar desde otro dispositivo en la LAN

bash
# Desde cualquier portátil/teléfono/tableta en la misma red:
curl http://macmini.local:11434/api/chat -d '{
  "model": "llama3.1:8b",
  "messages": [{"role": "user", "content": "¡Hola desde mi teléfono!"}]
}'

Acceso remoto: usa tu servidor de IA Mac Mini desde cualquier lugar

Dos opciones para acceder a tu servidor de IA Mac Mini desde fuera de tu red doméstica: Tailscale (recomendado para uso personal) y Cloudflare Tunnel (para endpoints accesibles desde la web).

bash
# Opción 1: Tailscale (Recomendado) — instalar en Mac Mini
brew install --cask tailscale
# Inicia sesión con la app de Tailscale — Mac Mini obtiene una IP privada
# Accede desde cualquier lugar con Tailscale instalado:
curl http://macmini.tailnet.ts.net:11434/api/chat -d '{...}'

# Opción 2: Cloudflare Tunnel (Acceso web)
brew install cloudflared
cloudflared tunnel create ai-server
cloudflared tunnel route dns ai-server ai.tudominio.com
# Accesible en https://ai.tudominio.com desde cualquier lugar

Cuatro casos de uso reales para el servidor de IA Mac Mini

El servidor de IA Mac Mini cubre cuatro casos de uso principales. Cada uno es un flujo de trabajo independiente — puedes ejecutar los cuatro simultáneamente en el M5 Pro 64 GB.

Caso de uso 1: Servidor de IA familiar para el hogar

El Mac Mini está en un armario funcionando 24/7. Todos los dispositivos de la red doméstica — teléfonos, tabletas, portátiles — envían solicitudes API a la misma instancia de Ollama. Una familia de 4 personas con iPhones, iPads y MacBooks lo usan simultáneamente.

Los iPhone usan Atajos → POST a macmini.local:11434. Los usuarios de MacBook usan Continue.dev o extensiones de Raycast. Ajusta OLLAMA_NUM_PARALLEL=2 para que dos miembros de la familia puedan chatear simultáneamente con Llama 3.1 8B.

Sustituye 4 suscripciones a ChatGPT Plus ($80/mes = $960/año). Periodo de amortización del Mac Mini: ~15 meses. Del año 2 al 5: ahorro puro.

Caso de uso 2: Servidor privado de preguntas y respuestas sobre documentos con RAG

Pila: Ollama (Llama 3.1 8B) + nomic-embed-text + ChromaDB. Todo ejecutándose en el Mac Mini, accesible desde la LAN. Casos de uso: documentos familiares, contratos legales, manuales técnicos, biblioteca de recetas, historial médico, artículos de investigación. Todo privado. Todo buscable. Todo sin conexión.

python
# Install ChromaDB via Docker
brew install --cask docker
docker run -d -p 8000:8000 -v ~/chromadb:/data chromadb/chroma

# Index documents (Python)
from langchain_community.embeddings import OllamaEmbeddings
from langchain_community.vectorstores import Chroma

embeddings = OllamaEmbeddings(
    model="nomic-embed-text",
    base_url="http://localhost:11434"
)
vectordb = Chroma.from_documents(
    documents=splits,
    embedding=embeddings,
    persist_directory="./chroma_db"
)

Caso de uso 3: Asistente de voz siempre activo

Pila en Mac Mini: whisper.cpp para STT (acelerado con Metal), Ollama Llama 3.1 8B para el razonamiento, Piper TTS para la salida de voz, protocolo Wyoming para la integración con Home Assistant.

Activado por palabra de activación desde dispositivos cliente (Apple HomePod vía Home Assistant, o matrices de micrófonos Raspberry Pi en cada habitación). Latencia extremo a extremo estimada en el M5 Pro: alrededor de 1,2 segundos (STT + LLM + TTS combinados) — una estimación basada en generaciones anteriores del Mac Mini con Apple Silicon y en las mejoras de rendimiento anunciadas por Apple; el Mac Mini M6/M5 Pro todavía no ha salido a la venta, por lo que no hay mediciones independientes disponibles.

Electricidad anual estimada: $35. Servicio cloud comparable (Alexa Plus a $20/mes): $240/año. Ahorra más de $200 al año manteniendo todos los datos de voz privados.

Caso de uso 4: Agente de código privado (integración con IDE)

Configura Continue.dev o Cursor para usar la API del Mac Mini. DeepSeek Coder V2 a 16B supera a GitHub Copilot en varios benchmarks de lenguajes — mientras mantiene todo el código privado y sin conexión.

  • $0/año (frente a GitHub Copilot a $10/mes por usuario)
  • El código nunca sale de tu red
  • Funciona sin conexión (aviones, oficinas seguras)
  • DeepSeek Coder V2 supera a Copilot en benchmarks de Go, Python y TypeScript
json
// ~/.continue/config.json
{
  "models": [{
    "title": "Mac Mini DeepSeek Coder",
    "provider": "ollama",
    "model": "deepseek-coder-v2:16b",
    "apiBase": "http://macmini.local:11434"
  }]
}

Consumo eléctrico y rendimiento térmico (estimados)

El Mac Mini M6/M5 Pro sale a la venta el 22 de septiembre de 2026 — PromptQuorum no ha probado este hardware. Las cifras siguientes son estimaciones basadas en las especificaciones TDP publicadas por Apple, las propias afirmaciones de rendimiento de Apple (hasta 4× el rendimiento de IA frente a la generación M4) y el comportamiento de consumo/térmico observado en generaciones anteriores del Mac Mini con Apple Silicon bajo cargas equivalentes de Ollama + Metal. Coste eléctrico calculado a $0,15/kWh.

  • Temperatura superficial bajo carga (estimada): 35–42 °C (caliente al tacto)
  • Temperatura interna de CPU (estimada): 65–75 °C (muy por debajo del umbral de limitación)
  • Ventilador: se espera que nunca se active en el M6, sin ventilador; activación breve a bajas RPM esperada en el M5 Pro durante picos
  • Las generaciones anteriores del Mac Mini con Apple Silicon no muestran limitación térmica bajo carga LLM sostenida — se espera que la generación M6/M5 Pro siga el mismo diseño térmico, pendiente de pruebas independientes tras el lanzamiento del 22 de septiembre de 2026
  • Ventilación: se recomienda espacio abierto — no colocar en un armario cerrado
  • Durabilidad del SSD: 600 TBW típico = ~30 años con patrones de escritura de servidor de IA
Carga de trabajoConsumo (estimado)Coste anual (24/7, $0,15/kWh)
Reposo8 W~$10/año
Inferencia Llama 8B25–35 W~$39/año
Inferencia Llama 34B40–55 W~$63/año
Carga mixta típica15–25 W~$26/año

Electricidad anual media estimada para carga mixta típica: $26–39. Se estima que un año completo de funcionamiento 24/7 cueste menos de un mes de ChatGPT Plus. Estas cifras se actualizarán con mediciones reales tras el lanzamiento.

Consumo estimado del Mac Mini M5 Pro por carga de trabajo: 8 W en reposo, 25–35 W en inferencia Llama 8B, 40–55 W en inferencia Llama 34B, frente a 200–300 W de un equipo de escritorio con RTX 4070. Estimaciones no medidas de forma independiente — lanzamiento el 22 de septiembre de 2026.
Consumo estimado del Mac Mini M5 Pro por carga de trabajo: 8 W en reposo, 25–35 W en inferencia Llama 8B, 40–55 W en inferencia Llama 34B, frente a 200–300 W de un equipo de escritorio con RTX 4070. Estimaciones no medidas de forma independiente — lanzamiento el 22 de septiembre de 2026.

Monitorización y mantenimiento para operación 24/7

Guarda este script de verificación de salud como ~/check-ai-server.sh — ejecútalo con cron o launchd cada hora para reiniciar Ollama automáticamente si se cuelga.

  • Mensual: Actualiza Ollama con `brew upgrade ollama`
  • Mensual: Actualiza los modelos con `ollama pull llama3.1:8b` (descarga la versión más reciente)
  • Mensual: Limpia modelos sin uso con `ollama list` y luego `ollama rm <nombre-del-modelo>`
  • Mensual: Aplica actualizaciones de macOS desde Ajustes del Sistema → Actualización de software
  • Mensual: Reinicia el Mac Mini (limpieza de memoria, elimina cualquier estado acumulado)
bash
#!/bin/bash
echo "=== AI Server Health Check ==="
echo "Date: $(date)"

if pgrep -x "ollama" > /dev/null; then
    echo "✓ Ollama running"
else
    echo "✗ Ollama NOT running - restarting"
    brew services restart ollama
fi

if curl -s http://localhost:11434/api/version > /dev/null; then
    echo "✓ API responding"
else
    echo "✗ API NOT responding"
fi

df -h / | tail -1
uptime

Análisis del coste total de propiedad a 5 años

  • Periodo de amortización para una familia de 4 que sustituye ChatGPT Plus (al precio inicial de $1.699): ~19 meses
  • Agente de código (sustituyendo Copilot a $10/usuario/mes) — 1 desarrollador: amortizado en ~15 meses
  • Agente de código — equipo de 4 desarrolladores: amortizado en ~4 meses
  • Agente de código — equipo de 10 personas: amortizado en ~1,5 meses
AñoServidor de IA Mac Mini4× ChatGPT PlusDiferencia
Año 1Desde $1.699 hardware + $35 electricidad = $1.734$960−$774 (Mac más caro en A1)
Año 2$35 (solo electricidad)$960+$925 ahorrado
Año 3$35$960+$925 ahorrado
Año 4$35$960+$925 ahorrado
Año 5$35$960+$925 ahorrado
Total 5 añosDesde $1.874$4.800+$2.926 ahorrado

TCO asume $960/año (4× ChatGPT Plus a $20/mes cada uno) y el precio inicial de $1.699 del M5 Pro. Apple aún no ha publicado precios para las configuraciones de memoria por encima de la base, así que la configuración de 64 GB usada en esta guía probablemente cuesta más — consulta apple.com para el precio exacto configurado. Todos los datos privados, sin coste por consulta, con funcionalidad sin conexión incluida.

¿Es el nuevo Mac Mini más silencioso que las alternativas?

Sí, por diseño. El M6 base es completamente sin ventilador. Se espera que el ventilador del M5 Pro rara vez gire, y que sea muy silencioso cuando lo hace — como en generaciones anteriores del Mac Mini con Apple Silicon. PC con GPU de escritorio: ~50–70 dB. Mac Mini: se espera cerca de 0 dB en reposo, dB bajos brevemente bajo carga intensa de 34B+. Todavía no hay mediciones de ruido independientes; el hardware sale a la venta el 22 de septiembre de 2026.

¿Puedo acceder remotamente al Mac Mini?

Sí — por SSH desde el terminal, o con Compartir Pantalla (VNC) desde Ajustes del Sistema → Compartir → Gestión Remota. En la LAN: ssh usuario@macmini.local. Para acceso remoto: usa primero Tailscale y luego SSH a través de la IP de Tailscale.

¿Qué hago si necesito mayor rendimiento?

Ruta de actualización: consulta la gama actual de Mac Studio de Apple para un límite de memoria unificada más alto y más núcleos de GPU que el Mac Mini. Para granjas de servidores, conecta varios Mac Mini en rack y balancea la carga con Nginx.

¿Cuánto dura el Mac Mini como servidor de IA 24/7?

Los Mac con Apple Silicon están diseñados para operación sostenida. Vida útil esperada: 7–10 años para uso como servidor de IA. Durabilidad del SSD (600 TBW típico) cubre 25–30 años de cargas de trabajo de IA. Tasa de fallo de hardware anual inferior al 0,5 %.

¿Puedo atender a varios usuarios simultáneamente?

Sí. Ajusta OLLAMA_NUM_PARALLEL=2 (o más con más memoria) para gestionar solicitudes concurrentes. Se espera que el M5 Pro de 64 GB maneje cómodamente a 2–3 usuarios simultáneos con modelos de 8B; el M6 de 32 GB ofrece menos margen para esto.

¿Qué ocurre si el Mac Mini pierde la alimentación?

Tras la restauración de la alimentación, macOS arranca automáticamente si activaste "Iniciar automáticamente tras un fallo de alimentación" en Ajustes del Sistema → Energía. Ollama arranca como servicio de brew. Los modelos se recargan con la primera solicitud (retraso de 5–15 s en la primera respuesta tras el reinicio).

¿Puedo añadir una GPU externa al Mac Mini para inferencia más rápida?

No. Apple Silicon no admite GPUs externas para aceleración Metal/ML. La arquitectura de memoria unificada es el diseño — no se puede añadir GPU discreta. Para más velocidad, consulta la gama actual de Mac Studio de Apple.

¿Es el Mac Mini demasiado potente o insuficiente para un servidor de IA?

Para hogares de 1–4 personas o equipos pequeños que ejecutan modelos de 8B–34B: justo lo necesario, con el M5 Pro de 64 GB. Para modelos de 70B o más: insuficiente — consulta la gama Mac Studio de Apple para límites de memoria más altos. Para modelos pequeños con presupuesto de aficionado: demasiado potente (Raspberry Pi 5 solo cubre modelos de 1–3B, insuficiente para cualquier uso práctico en 2026). Para ejecutar la pila completa de cuatro servicios (LLM + Whisper + RAG + voz) simultáneamente: el M6 base con límite de 32 GB es insuficiente — usa el M5 Pro de 64 GB.

¿Existe un Mac Mini simplemente "M5"?

No. El anuncio de Apple del 25 de agosto de 2026 usa el chip M6 para el Mac Mini base y el chip M5 Pro para el nivel superior — Apple omitió por completo un "M5" simple para la línea Mac Mini (el chip M5 salió antes en 2026 en la línea MacBook Air/Pro, no en el Mac Mini).

¿Listo para configurar Ollama en tu Mac Mini M6 o M5 Pro? Aquí tienes la guía completa de instalación.

Ollama en Mac — Guía de configuración 2026 →

Nota sobre hechos de terceros

Este artículo hace referencia a modelos de IA, benchmarks, precios y licencias de terceros. El panorama de la IA cambia rápidamente. Las puntuaciones de benchmark, los términos de licencia, los nombres de modelos y los precios de API pueden cambiar entre el momento en que se escribió y cuando usted lo lee. Antes de tomar decisiones de despliegue o cumplimiento basadas en este artículo, verifique las cifras actuales en la fuente oficial de cada proveedor: tarjetas de modelos de Hugging Face para licencias y benchmarks, sitios web de proveedores para precios de API y EUR-Lex para el texto actualizado del RGPD y la Ley de IA de la UE.

¿Ya tienes tu servidor de IA Mac Mini funcionando? Compara las respuestas de tu Llama o DeepSeek local con GPT-4, Claude, Gemini y otros 22 modelos en un solo envío con PromptQuorum — verifica que tu configuración autoalojada entrega respuestas de calidad cloud para tus casos de uso.

Download the PromptQuorum Beta →

← Back to Local LLMs