Peut-on exécuter un LLM local sur un Raspberry Pi 5 ?

Cette page contient des liens de référence vers des produits tiers. PromptQuorum n'est inscrit à aucun programme d'affiliation — ce sont de simples liens qui ne génèrent aucune commission. Cliquer sur les liens et vos prochaines étapes relèvent entièrement de votre responsabilité. Ces liens ne représentent aucune approbation ou vérification par PromptQuorum.
Réponse rapide
Oui. Le Pi 5 (8 Go) exécute des modèles 1B-3B via Ollama ou llama.cpp en s'appuyant uniquement sur le CPU — c'est à peu près le plafond pratique. Ajoutez le Raspberry Pi AI HAT+ 2 officiel (NPU Hailo-10H) pour une accélération GenAI dédiée, son propre serveur Hailo Ollama, et de la marge pour des modèles plus grands.
- ▸Meilleure configuration économique : Pi 5 8 Go + refroidissement actif — le moyen le moins cher d'expérimenter avec de petits modèles.
- ▸Meilleure configuration IA : Pi 5 + Raspberry Pi AI HAT+ 2 — un NPU Hailo-10H dédié, conçu pour les charges GenAI.
- ▸Plage de modèles avec le Pi 5 seul : environ 1B-3B paramètres en Q4 — ne vous attendez pas à la vitesse d'une GPU de bureau.
- ▸Meilleur usage : un assistant privé toujours actif, de l'automatisation domestique ou de l'expérimentation hors ligne — pas un chatbot quotidien rapide.
Points clés
- ✓Oui — le Raspberry Pi 5 en 8 Go exécute des modèles 1B-3B via Ollama ou llama.cpp en s'appuyant uniquement sur le CPU
- ✓Le Raspberry Pi AI HAT+ 2 officiel ajoute un NPU Hailo-10H conçu spécifiquement pour le GenAI embarqué, avec son propre serveur Hailo Ollama
- ✓Achetez la configuration 8 Go — le modèle 4 Go laisse trop peu de marge pour le modèle plus le système d'exploitation
- ✓Le refroidissement actif vaut le coup pour toute charge d'inférence soutenue, pas seulement pour de brefs tests
- ✓Meilleur usage : un assistant privé toujours actif, de l'automatisation domestique ou de l'expérimentation hors ligne — pas un chatbot quotidien rapide
- ✓Pour un usage sérieux de LLM local en 7B ou plus, un PC équipé d'un GPU ou un mini PC surpasseront toute configuration Pi 5
Configuration économique : le Raspberry Pi 5 seul
Un Raspberry Pi 5 nu (8 Go) exécute des modèles de 1B-3B paramètres en quantification Q4 via Ollama ou llama.cpp — des modèles comme Llama 3.2 1B, Llama 3.2 3B ou Qwen3 1.7B. Tout tourne sur le CPU quadricœur : le GPU VideoCore intégré du Pi 5 n'est pas un accélérateur llama.cpp utilisable en pratique, il n'y a donc pas d'accélération GPU notable sur la carte nue.
Les benchmarks communautaires situent les petits modèles Q4 à environ 4-9 tokens par seconde sur le CPU du Pi 5, selon le modèle exact et le runtime — nettement plus lent que l'inférence sur GPU de bureau, mais utilisable pour de courtes requêtes et de l'expérimentation occasionnelle.
Idéal pour : des assistants hors ligne pour des requêtes simples, des expériences Home Assistant, des scripts d'automatisation, et apprendre le fonctionnement de l'inférence locale. Achetez la configuration 8 Go — la version 4 Go laisse trop peu de marge pour un modèle plus Raspberry Pi OS.
Mieux : Pi 5 + Raspberry Pi AI HAT+ 2
Le Raspberry Pi AI HAT+ 2 officiel transforme un Pi 5 en système d'IA embarquée conçu pour cela, en ajoutant un NPU Hailo-10H et 8 Go de mémoire dédiée. La documentation officielle de Raspberry Pi confirme la prise en charge GenAI/LLM via un Hailo GenAI Model Zoo, avec notamment un serveur Hailo Ollama interrogeable sur le réseau ou via une interface de chat dans le navigateur.
Le Hailo-10H délivre 40 TOPS de performance d'inférence INT4 et est livré avec plusieurs petits modèles prêts à l'emploi (environ 1B-1,5B paramètres, dont des variantes de Qwen2 et Llama 3.2) — une voie notablement différente et plus rapide que l'inférence CPU seule, pour qui veut un vrai appareil d'IA embarquée plutôt qu'une expérimentation de loisir.
Achetez cette configuration si vous voulez une accélération GenAI dédiée et acceptez une pile logicielle encore en maturation — Raspberry Pi a lancé l'AI HAT+ 2 en janvier 2026, et la version de paquet documentée peut accuser un retard sur le rythme de publication propre à Hailo.
Pi 5 vs Pi 5 + AI HAT+ 2 vs un PC équipé d'un GPU
Ajouter l'AI HAT+ 2 réduit une partie de l'écart avec un GPU, mais un GPU discret ou un PC équipé d'un GPU l'emporte toujours sur la taille des modèles et la vitesse brute.
| Configuration | Capacité IA locale | Idéal pour |
|---|---|---|
| Pi 5 seul | Modèles 1B-3B, CPU seul | Expérience la moins chère, apprentissage |
| Pi 5 + AI HAT+ 2 | NPU dédié, modèles GenAI 1B-1,5B | Vrai appareil d'IA embarquée, axé GenAI |
| PC GPU / mini PC | Modèles 7B+, bien plus rapide | Usage quotidien sérieux de LLM local |
Refroidissement pour une inférence soutenue
Une inférence soutenue, intensive en CPU ou en NPU, chauffe davantage l'appareil qu'un usage occasionnel — le ventilateur actif officiel de Raspberry Pi (un dissipateur à clipser avec ventilateur piloté par la température) est un ajout peu coûteux et bien documenté si vous prévoyez de faire tourner l'inférence sur de longues périodes plutôt que de brefs tests.
Stockage NVMe pour un serveur permanent
Si le Pi devient un serveur d'IA locale fonctionnant en permanence, le stockage NVMe via le Raspberry Pi M.2 HAT+ officiel (qui utilise l'interface PCIe du Pi 5) est plus fiable sous charge de lecture/écriture soutenue qu'une carte microSD — un ajout pertinent une fois passé le stade des tests occasionnels.
Que peut-on vraiment construire ?
Une installation de LLM local sur Pi 5 convient à des expériences d'assistant domestique privé, des intégrations domotiques (voir notre guide pour construire un assistant vocal local pour des attentes de latence réalistes sur du matériel de classe Pi), de la classification de documents simple, et des services hors ligne fonctionnant en permanence qui n'ont pas besoin de réponses rapides.
Conclusion
Le moins cher : un Pi 5 8 Go nu pour des modèles 1B-3B et de l'expérimentation. Meilleure configuration IA à base de Pi : Pi 5 + l'AI HAT+ 2 officiel pour une accélération Hailo-10H dédiée. Meilleure performance globale : un PC équipé d'un GPU ou un mini PC conçu pour les LLM locaux — pour des modèles de 7B et plus, aucune configuration Pi ne s'en approche.
Lectures complémentaires
- ▸Meilleur LLM local pour 6 Go de VRAM — une alternative GPU réellement pratique à petit budget
- ▸De combien de RAM un modèle 7B a-t-il besoin ? — pourquoi le 7B est hors de portée du CPU d'un Pi 5
- ▸Meilleur mini PC pour un serveur Ollama permanent — une alternative permanente plus pratique
- ▸Construire un assistant vocal local — latence réaliste selon les niveaux de matériel Pi, mini PC et GPU
Questions fréquentes
Le Raspberry Pi 5 a-t-il besoin d'un refroidissement actif pour l'inférence LLM ?▾
Le Raspberry Pi AI HAT+ 2 prend-il vraiment en charge les LLM ?▾
Ollama est-il le meilleur moyen d'exécuter un LLM sur un Raspberry Pi 5 ?▾
Un Raspberry Pi 5 convient-il pour un assistant vocal avec un LLM local ?▾
Quelle est la RAM minimale pour un LLM local sur un Pi 5 ?▾
Prompt Bites associés