¿Puedes Ejecutar un LLM Local en una Raspberry Pi 5?

Esta página contiene enlaces de referencia a productos de terceros. PromptQuorum no participa en ningún programa de afiliados — son enlaces simples que no generan comisión. Hacer clic en los enlaces y los pasos siguientes son de su entera responsabilidad. Estos enlaces no representan ningún respaldo ni verificación por parte de PromptQuorum.
Respuesta rápida
Sí. La Pi 5 (8GB) ejecuta modelos de 1B-3B vía Ollama o llama.cpp usando solo la CPU — ese es aproximadamente el techo práctico. Añade la Raspberry Pi AI HAT+ 2 oficial (NPU Hailo-10H) para aceleración GenAI dedicada, su propio servidor Hailo Ollama y margen para modelos más grandes.
- ▸Mejor configuración económica: Pi 5 8GB + refrigeración activa — la forma más barata de experimentar con modelos diminutos.
- ▸Mejor configuración de IA: Pi 5 + Raspberry Pi AI HAT+ 2 — una NPU Hailo-10H dedicada, construida para cargas de trabajo GenAI.
- ▸Rango de modelos solo con la Pi 5: aproximadamente 1B-3B parámetros en Q4 — no esperes velocidad de GPU de escritorio.
- ▸Mejor uso: un asistente privado siempre encendido, automatización del hogar o experimentación sin conexión — no un chatbot rápido de uso diario.
Puntos clave
- ✓Sí — la Raspberry Pi 5 de 8GB ejecuta modelos de 1B-3B vía Ollama o llama.cpp usando solo la CPU
- ✓La Raspberry Pi AI HAT+ 2 oficial añade una NPU Hailo-10H construida específicamente para GenAI en el dispositivo, con su propio servidor Hailo Ollama
- ✓Compra la configuración de 8GB — la de 4GB deja muy poco margen para el modelo más el sistema operativo
- ✓La refrigeración activa vale la pena para cualquier carga de inferencia sostenida, no solo pruebas breves
- ✓Mejor uso: un asistente privado siempre encendido, automatización del hogar o experimentación sin conexión — no un chatbot rápido de uso diario
- ✓Para un uso serio de LLM local de 7B o más, un PC con GPU o una mini PC superarán a cualquier configuración de Pi 5
Configuración Económica: Solo la Raspberry Pi 5
Una Raspberry Pi 5 desnuda (8GB) ejecuta modelos de 1B-3B parámetros con cuantización Q4 a través de Ollama o llama.cpp — modelos como Llama 3.2 1B, Llama 3.2 3B o Qwen3 1.7B. Todo corre en la CPU de cuatro núcleos: la GPU VideoCore integrada de la Pi 5 no es un acelerador práctico para llama.cpp, así que no hay una aceleración de GPU significativa en la placa desnuda.
Los benchmarks de la comunidad sitúan los modelos pequeños en Q4 en aproximadamente 4-9 tokens por segundo en la CPU de la Pi 5, según el modelo exacto y el runtime — notablemente más lento que la inferencia en GPU de escritorio, pero usable para consultas cortas y experimentación casual.
Ideal para: asistentes sin conexión para consultas simples, experimentos con Home Assistant, scripts de automatización y aprender cómo funciona la inferencia local. Compra la configuración de 8GB — el modelo de 4GB deja muy poco margen para un modelo más Raspberry Pi OS.
Mejor: Pi 5 + Raspberry Pi AI HAT+ 2
La Raspberry Pi AI HAT+ 2 oficial convierte una Pi 5 en un sistema de IA de borde diseñado específicamente para ello, añadiendo una NPU Hailo-10H y 8GB de memoria dedicada. La propia documentación de Raspberry Pi confirma soporte de GenAI/LLM a través de un Hailo GenAI Model Zoo, incluyendo un servidor Hailo Ollama al que puedes consultar por red o mediante una interfaz de chat basada en navegador.
La Hailo-10H ofrece 40 TOPS de rendimiento de inferencia INT4 y viene con varios modelos pequeños listos para usar (aproximadamente 1B-1.5B parámetros, incluyendo variantes de Qwen2 y Llama 3.2) — un camino notablemente distinto y más rápido que la inferencia solo en CPU para quien quiera un dispositivo de IA de borde real y no un experimento de aficionado.
Compra esto si quieres aceleración GenAI dedicada y te sientes cómodo con una pila de software aún en maduración — Raspberry Pi lanzó la AI HAT+ 2 en enero de 2026, y la versión de paquete documentada puede ir por detrás del propio ritmo de lanzamientos de Hailo.
Pi 5 vs. Pi 5 + AI HAT+ 2 vs. un PC con GPU
Añadir la AI HAT+ 2 reduce parte de la brecha con una GPU, pero una GPU discreta o un PC con GPU sigue ganando en tamaño de modelo y velocidad puros.
| Configuración | Capacidad de IA local | Ideal para |
|---|---|---|
| Solo Pi 5 | Modelos 1B-3B, solo CPU | Experimento más barato, aprendizaje |
| Pi 5 + AI HAT+ 2 | NPU dedicada, modelos GenAI 1B-1.5B | Dispositivo de IA de borde real, enfocado en GenAI |
| PC con GPU / mini PC | Modelos 7B+, mucho más rápido | Uso diario serio de LLM local |
Refrigeración para Inferencia Sostenida
La inferencia sostenida e intensiva en CPU o NPU calienta más el dispositivo que el uso casual — el disipador activo oficial de Raspberry Pi (un disipador de calor a presión con ventilador controlado por temperatura) es una adición barata y bien documentada si planeas ejecutar inferencia durante períodos prolongados en lugar de pruebas breves.
Almacenamiento NVMe para un Servidor Siempre Encendido
Si la Pi se convierte en un servidor de IA local siempre encendido, el almacenamiento NVMe a través del Raspberry Pi M.2 HAT+ oficial (que usa la interfaz PCIe de la Pi 5) es más fiable bajo carga sostenida de lectura/escritura que una tarjeta microSD — vale la pena añadirlo una vez que superas las pruebas casuales.
¿Qué Puedes Construir Realmente?
Un montaje de LLM local en la Pi 5 encaja con experimentos de asistente doméstico privado, integraciones de automatización del hogar (consulta nuestra guía para construir un asistente de voz local para expectativas realistas de latencia en hardware de clase Pi), clasificación sencilla de documentos y servicios sin conexión siempre encendidos que no necesitan respuestas rápidas.
Conclusión
La opción más barata: una Pi 5 8GB desnuda para modelos de 1B-3B y experimentación. Mejor configuración de IA basada en Pi: Pi 5 + la AI HAT+ 2 oficial para aceleración dedicada Hailo-10H. Mejor rendimiento general: un PC con GPU o una mini PC diseñada para LLM local — para modelos de 7B en adelante, ninguna configuración de Pi se acerca.
Lecturas Relacionadas
- ▸Mejor LLM Local para 6 GB de VRAM — una alternativa de GPU económica genuinamente práctica
- ▸¿Cuánta RAM Necesita un Modelo de 7B? — por qué 7B está fuera del alcance de la CPU de una Pi 5
- ▸Mejor Mini PC para un Servidor Ollama Siempre Encendido — una alternativa siempre encendida más práctica
- ▸Construir un Asistente de Voz Local — latencia realista entre niveles de hardware Pi, mini PC y GPU
Preguntas Frecuentes
¿Necesita la Raspberry Pi 5 refrigeración activa para inferencia de LLM?▾
¿La Raspberry Pi AI HAT+ 2 soporta realmente LLM?▾
¿Es Ollama la mejor forma de ejecutar un LLM en una Raspberry Pi 5?▾
¿Es buena una Raspberry Pi 5 para un asistente de voz con un LLM local?▾
¿Cuál es la RAM mínima para cualquier LLM local en una Pi 5?▾
Prompt Bites relacionados