Skip to main content
PromptQuorum

¿Puedes Ejecutar un LLM Local en una Raspberry Pi 5?

¿Puedes Ejecutar un LLM Local en una Raspberry Pi 5?

Esta página contiene enlaces de referencia a productos de terceros. PromptQuorum no participa en ningún programa de afiliados — son enlaces simples que no generan comisión. Hacer clic en los enlaces y los pasos siguientes son de su entera responsabilidad. Estos enlaces no representan ningún respaldo ni verificación por parte de PromptQuorum.

Consulta el precio de la Raspberry Pi 5 8GBenlace de producto · divulgadoConsulta el precio de la Raspberry Pi AI HAT+ 2enlace de producto · divulgado

Respuesta rápida

Sí. La Pi 5 (8GB) ejecuta modelos de 1B-3B vía Ollama o llama.cpp usando solo la CPU — ese es aproximadamente el techo práctico. Añade la Raspberry Pi AI HAT+ 2 oficial (NPU Hailo-10H) para aceleración GenAI dedicada, su propio servidor Hailo Ollama y margen para modelos más grandes.

  • Mejor configuración económica: Pi 5 8GB + refrigeración activa — la forma más barata de experimentar con modelos diminutos.
  • Mejor configuración de IA: Pi 5 + Raspberry Pi AI HAT+ 2 — una NPU Hailo-10H dedicada, construida para cargas de trabajo GenAI.
  • Rango de modelos solo con la Pi 5: aproximadamente 1B-3B parámetros en Q4 — no esperes velocidad de GPU de escritorio.
  • Mejor uso: un asistente privado siempre encendido, automatización del hogar o experimentación sin conexión — no un chatbot rápido de uso diario.
Quick AnswersIntermedio

Puntos clave

  • Sí — la Raspberry Pi 5 de 8GB ejecuta modelos de 1B-3B vía Ollama o llama.cpp usando solo la CPU
  • La Raspberry Pi AI HAT+ 2 oficial añade una NPU Hailo-10H construida específicamente para GenAI en el dispositivo, con su propio servidor Hailo Ollama
  • Compra la configuración de 8GB — la de 4GB deja muy poco margen para el modelo más el sistema operativo
  • La refrigeración activa vale la pena para cualquier carga de inferencia sostenida, no solo pruebas breves
  • Mejor uso: un asistente privado siempre encendido, automatización del hogar o experimentación sin conexión — no un chatbot rápido de uso diario
  • Para un uso serio de LLM local de 7B o más, un PC con GPU o una mini PC superarán a cualquier configuración de Pi 5

Configuración Económica: Solo la Raspberry Pi 5

Una Raspberry Pi 5 desnuda (8GB) ejecuta modelos de 1B-3B parámetros con cuantización Q4 a través de Ollama o llama.cpp — modelos como Llama 3.2 1B, Llama 3.2 3B o Qwen3 1.7B. Todo corre en la CPU de cuatro núcleos: la GPU VideoCore integrada de la Pi 5 no es un acelerador práctico para llama.cpp, así que no hay una aceleración de GPU significativa en la placa desnuda.

Los benchmarks de la comunidad sitúan los modelos pequeños en Q4 en aproximadamente 4-9 tokens por segundo en la CPU de la Pi 5, según el modelo exacto y el runtime — notablemente más lento que la inferencia en GPU de escritorio, pero usable para consultas cortas y experimentación casual.

Ideal para: asistentes sin conexión para consultas simples, experimentos con Home Assistant, scripts de automatización y aprender cómo funciona la inferencia local. Compra la configuración de 8GB — el modelo de 4GB deja muy poco margen para un modelo más Raspberry Pi OS.

Consulta el precio de la Raspberry Pi 5 8GBenlace de producto · divulgado

Mejor: Pi 5 + Raspberry Pi AI HAT+ 2

La Raspberry Pi AI HAT+ 2 oficial convierte una Pi 5 en un sistema de IA de borde diseñado específicamente para ello, añadiendo una NPU Hailo-10H y 8GB de memoria dedicada. La propia documentación de Raspberry Pi confirma soporte de GenAI/LLM a través de un Hailo GenAI Model Zoo, incluyendo un servidor Hailo Ollama al que puedes consultar por red o mediante una interfaz de chat basada en navegador.

La Hailo-10H ofrece 40 TOPS de rendimiento de inferencia INT4 y viene con varios modelos pequeños listos para usar (aproximadamente 1B-1.5B parámetros, incluyendo variantes de Qwen2 y Llama 3.2) — un camino notablemente distinto y más rápido que la inferencia solo en CPU para quien quiera un dispositivo de IA de borde real y no un experimento de aficionado.

Compra esto si quieres aceleración GenAI dedicada y te sientes cómodo con una pila de software aún en maduración — Raspberry Pi lanzó la AI HAT+ 2 en enero de 2026, y la versión de paquete documentada puede ir por detrás del propio ritmo de lanzamientos de Hailo.

Pi 5 vs. Pi 5 + AI HAT+ 2 vs. un PC con GPU

Añadir la AI HAT+ 2 reduce parte de la brecha con una GPU, pero una GPU discreta o un PC con GPU sigue ganando en tamaño de modelo y velocidad puros.

ConfiguraciónCapacidad de IA localIdeal para
Solo Pi 5Modelos 1B-3B, solo CPUExperimento más barato, aprendizaje
Pi 5 + AI HAT+ 2NPU dedicada, modelos GenAI 1B-1.5BDispositivo de IA de borde real, enfocado en GenAI
PC con GPU / mini PCModelos 7B+, mucho más rápidoUso diario serio de LLM local

Refrigeración para Inferencia Sostenida

La inferencia sostenida e intensiva en CPU o NPU calienta más el dispositivo que el uso casual — el disipador activo oficial de Raspberry Pi (un disipador de calor a presión con ventilador controlado por temperatura) es una adición barata y bien documentada si planeas ejecutar inferencia durante períodos prolongados en lugar de pruebas breves.

Almacenamiento NVMe para un Servidor Siempre Encendido

Si la Pi se convierte en un servidor de IA local siempre encendido, el almacenamiento NVMe a través del Raspberry Pi M.2 HAT+ oficial (que usa la interfaz PCIe de la Pi 5) es más fiable bajo carga sostenida de lectura/escritura que una tarjeta microSD — vale la pena añadirlo una vez que superas las pruebas casuales.

Consulta el precio del Raspberry Pi M.2 HAT+enlace de producto · divulgado

¿Qué Puedes Construir Realmente?

Un montaje de LLM local en la Pi 5 encaja con experimentos de asistente doméstico privado, integraciones de automatización del hogar (consulta nuestra guía para construir un asistente de voz local para expectativas realistas de latencia en hardware de clase Pi), clasificación sencilla de documentos y servicios sin conexión siempre encendidos que no necesitan respuestas rápidas.

Conclusión

La opción más barata: una Pi 5 8GB desnuda para modelos de 1B-3B y experimentación. Mejor configuración de IA basada en Pi: Pi 5 + la AI HAT+ 2 oficial para aceleración dedicada Hailo-10H. Mejor rendimiento general: un PC con GPU o una mini PC diseñada para LLM local — para modelos de 7B en adelante, ninguna configuración de Pi se acerca.

Lecturas Relacionadas

Preguntas Frecuentes

¿Necesita la Raspberry Pi 5 refrigeración activa para inferencia de LLM?
Sí, para cargas sostenidas. La inferencia sostenida e intensiva en CPU o NPU calienta la Pi 5 más que el uso casual, y el disipador activo oficial es una adición barata y que vale la pena para sesiones de inferencia más largas.
¿La Raspberry Pi AI HAT+ 2 soporta realmente LLM?
Sí — confirmado por la propia documentación de Raspberry Pi. La NPU Hailo-10H de la AI HAT+ 2 ejecuta un conjunto documentado de modelos pequeños (aproximadamente 1B-1.5B parámetros) a través de un paquete Hailo GenAI Model Zoo y un servidor Hailo Ollama, accesible vía llamadas API o una interfaz de chat basada en navegador.
¿Es Ollama la mejor forma de ejecutar un LLM en una Raspberry Pi 5?
Ollama es la opción más sencilla para inferencia solo en CPU en la Pi 5 desnuda. llama.cpp da más control manual sobre la cuantización y las opciones de compilación. La AI HAT+ 2 usa su propio servidor Hailo Ollama separado en lugar de la ruta estándar de Ollama en CPU.
¿Es buena una Raspberry Pi 5 para un asistente de voz con un LLM local?
Solo con un modelo muy pequeño y expectativas de latencia realistas — consulta nuestra guía para construir un asistente de voz local, que cubre la Pi 5 solo con CPU como uno de varios niveles de hardware junto a opciones más rápidas de mini PC, GPU y Mac.
¿Cuál es la RAM mínima para cualquier LLM local en una Pi 5?
La configuración de 8GB es el mínimo práctico para una experiencia cómoda. La configuración de 4GB puede técnicamente cargar un modelo de 1B pero deja muy poco margen para cualquier otra cosa que corra en el dispositivo.