Skip to main content
PromptQuorum

Peut-on exécuter un LLM local sur un Raspberry Pi 5 ?

Peut-on exécuter un LLM local sur un Raspberry Pi 5 ?

Cette page contient des liens de référence vers des produits tiers. PromptQuorum n'est inscrit à aucun programme d'affiliation — ce sont de simples liens qui ne génèrent aucune commission. Cliquer sur les liens et vos prochaines étapes relèvent entièrement de votre responsabilité. Ces liens ne représentent aucune approbation ou vérification par PromptQuorum.

Réponse rapide

Oui. Le Pi 5 (8 Go) exécute des modèles 1B-3B via Ollama ou llama.cpp en s'appuyant uniquement sur le CPU — c'est à peu près le plafond pratique. Ajoutez le Raspberry Pi AI HAT+ 2 officiel (NPU Hailo-10H) pour une accélération GenAI dédiée, son propre serveur Hailo Ollama, et de la marge pour des modèles plus grands.

  • Meilleure configuration économique : Pi 5 8 Go + refroidissement actif — le moyen le moins cher d'expérimenter avec de petits modèles.
  • Meilleure configuration IA : Pi 5 + Raspberry Pi AI HAT+ 2 — un NPU Hailo-10H dédié, conçu pour les charges GenAI.
  • Plage de modèles avec le Pi 5 seul : environ 1B-3B paramètres en Q4 — ne vous attendez pas à la vitesse d'une GPU de bureau.
  • Meilleur usage : un assistant privé toujours actif, de l'automatisation domestique ou de l'expérimentation hors ligne — pas un chatbot quotidien rapide.
Quick AnswersIntermédiaire

Points clés

  • Oui — le Raspberry Pi 5 en 8 Go exécute des modèles 1B-3B via Ollama ou llama.cpp en s'appuyant uniquement sur le CPU
  • Le Raspberry Pi AI HAT+ 2 officiel ajoute un NPU Hailo-10H conçu spécifiquement pour le GenAI embarqué, avec son propre serveur Hailo Ollama
  • Achetez la configuration 8 Go — le modèle 4 Go laisse trop peu de marge pour le modèle plus le système d'exploitation
  • Le refroidissement actif vaut le coup pour toute charge d'inférence soutenue, pas seulement pour de brefs tests
  • Meilleur usage : un assistant privé toujours actif, de l'automatisation domestique ou de l'expérimentation hors ligne — pas un chatbot quotidien rapide
  • Pour un usage sérieux de LLM local en 7B ou plus, un PC équipé d'un GPU ou un mini PC surpasseront toute configuration Pi 5

Configuration économique : le Raspberry Pi 5 seul

Un Raspberry Pi 5 nu (8 Go) exécute des modèles de 1B-3B paramètres en quantification Q4 via Ollama ou llama.cpp — des modèles comme Llama 3.2 1B, Llama 3.2 3B ou Qwen3 1.7B. Tout tourne sur le CPU quadricœur : le GPU VideoCore intégré du Pi 5 n'est pas un accélérateur llama.cpp utilisable en pratique, il n'y a donc pas d'accélération GPU notable sur la carte nue.

Les benchmarks communautaires situent les petits modèles Q4 à environ 4-9 tokens par seconde sur le CPU du Pi 5, selon le modèle exact et le runtime — nettement plus lent que l'inférence sur GPU de bureau, mais utilisable pour de courtes requêtes et de l'expérimentation occasionnelle.

Idéal pour : des assistants hors ligne pour des requêtes simples, des expériences Home Assistant, des scripts d'automatisation, et apprendre le fonctionnement de l'inférence locale. Achetez la configuration 8 Go — la version 4 Go laisse trop peu de marge pour un modèle plus Raspberry Pi OS.

Mieux : Pi 5 + Raspberry Pi AI HAT+ 2

Le Raspberry Pi AI HAT+ 2 officiel transforme un Pi 5 en système d'IA embarquée conçu pour cela, en ajoutant un NPU Hailo-10H et 8 Go de mémoire dédiée. La documentation officielle de Raspberry Pi confirme la prise en charge GenAI/LLM via un Hailo GenAI Model Zoo, avec notamment un serveur Hailo Ollama interrogeable sur le réseau ou via une interface de chat dans le navigateur.

Le Hailo-10H délivre 40 TOPS de performance d'inférence INT4 et est livré avec plusieurs petits modèles prêts à l'emploi (environ 1B-1,5B paramètres, dont des variantes de Qwen2 et Llama 3.2) — une voie notablement différente et plus rapide que l'inférence CPU seule, pour qui veut un vrai appareil d'IA embarquée plutôt qu'une expérimentation de loisir.

Achetez cette configuration si vous voulez une accélération GenAI dédiée et acceptez une pile logicielle encore en maturation — Raspberry Pi a lancé l'AI HAT+ 2 en janvier 2026, et la version de paquet documentée peut accuser un retard sur le rythme de publication propre à Hailo.

Pi 5 vs Pi 5 + AI HAT+ 2 vs un PC équipé d'un GPU

Ajouter l'AI HAT+ 2 réduit une partie de l'écart avec un GPU, mais un GPU discret ou un PC équipé d'un GPU l'emporte toujours sur la taille des modèles et la vitesse brute.

ConfigurationCapacité IA localeIdéal pour
Pi 5 seulModèles 1B-3B, CPU seulExpérience la moins chère, apprentissage
Pi 5 + AI HAT+ 2NPU dédié, modèles GenAI 1B-1,5BVrai appareil d'IA embarquée, axé GenAI
PC GPU / mini PCModèles 7B+, bien plus rapideUsage quotidien sérieux de LLM local

Refroidissement pour une inférence soutenue

Une inférence soutenue, intensive en CPU ou en NPU, chauffe davantage l'appareil qu'un usage occasionnel — le ventilateur actif officiel de Raspberry Pi (un dissipateur à clipser avec ventilateur piloté par la température) est un ajout peu coûteux et bien documenté si vous prévoyez de faire tourner l'inférence sur de longues périodes plutôt que de brefs tests.

Stockage NVMe pour un serveur permanent

Si le Pi devient un serveur d'IA locale fonctionnant en permanence, le stockage NVMe via le Raspberry Pi M.2 HAT+ officiel (qui utilise l'interface PCIe du Pi 5) est plus fiable sous charge de lecture/écriture soutenue qu'une carte microSD — un ajout pertinent une fois passé le stade des tests occasionnels.

Que peut-on vraiment construire ?

Une installation de LLM local sur Pi 5 convient à des expériences d'assistant domestique privé, des intégrations domotiques (voir notre guide pour construire un assistant vocal local pour des attentes de latence réalistes sur du matériel de classe Pi), de la classification de documents simple, et des services hors ligne fonctionnant en permanence qui n'ont pas besoin de réponses rapides.

Conclusion

Le moins cher : un Pi 5 8 Go nu pour des modèles 1B-3B et de l'expérimentation. Meilleure configuration IA à base de Pi : Pi 5 + l'AI HAT+ 2 officiel pour une accélération Hailo-10H dédiée. Meilleure performance globale : un PC équipé d'un GPU ou un mini PC conçu pour les LLM locaux — pour des modèles de 7B et plus, aucune configuration Pi ne s'en approche.

Lectures complémentaires

Questions fréquentes

Le Raspberry Pi 5 a-t-il besoin d'un refroidissement actif pour l'inférence LLM ?
Oui, pour les charges soutenues. Une inférence soutenue, intensive en CPU ou en NPU, chauffe davantage le Pi 5 qu'un usage occasionnel, et le ventilateur actif officiel est un ajout peu coûteux et pertinent pour des sessions d'inférence plus longues.
Le Raspberry Pi AI HAT+ 2 prend-il vraiment en charge les LLM ?
Oui — confirmé par la documentation officielle de Raspberry Pi. Le NPU Hailo-10H de l'AI HAT+ 2 fait tourner un ensemble documenté de petits modèles (environ 1B-1,5B paramètres) via un paquet Hailo GenAI Model Zoo et un serveur Hailo Ollama, accessible par appels API ou via une interface de chat dans le navigateur.
Ollama est-il le meilleur moyen d'exécuter un LLM sur un Raspberry Pi 5 ?
Ollama est l'option la plus simple pour l'inférence CPU seule sur le Pi 5 nu. llama.cpp offre plus de contrôle manuel sur la quantification et les options de compilation. L'AI HAT+ 2 utilise son propre serveur Hailo Ollama séparé plutôt que le chemin CPU standard d'Ollama.
Un Raspberry Pi 5 convient-il pour un assistant vocal avec un LLM local ?
Seulement avec un très petit modèle et des attentes de latence réalistes — voir notre guide pour construire un assistant vocal local, qui traite le Pi 5 CPU seul comme l'un des plusieurs niveaux de matériel, aux côtés d'options mini PC, GPU et Mac plus rapides.
Quelle est la RAM minimale pour un LLM local sur un Pi 5 ?
La configuration 8 Go est le minimum pratique pour une expérience confortable. La configuration 4 Go peut techniquement charger un modèle 1B mais laisse très peu de marge pour tout autre élément fonctionnant sur l'appareil.