Kann man ein lokales LLM auf einem Raspberry Pi 5 betreiben?

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.
Schnelle Antwort
Ja. Der Pi 5 (8 GB) betreibt 1B-3B-Modelle über Ollama oder llama.cpp allein auf der CPU — das ist etwa die praktische Obergrenze. Mit dem offiziellen Raspberry Pi AI HAT+ 2 (Hailo-10H-NPU) gibt es dedizierte GenAI-Beschleunigung, einen eigenen Hailo-Ollama-Server und Spielraum für größere Modelle.
- ▸Bestes Budget-Setup: Pi 5 8 GB + aktive Kühlung — der günstigste Weg, mit winzigen Modellen zu experimentieren.
- ▸Bestes AI-Setup: Pi 5 + Raspberry Pi AI HAT+ 2 — eine dedizierte Hailo-10H-NPU speziell für GenAI-Workloads.
- ▸Modellbereich nur mit Pi 5: etwa 1B-3B Parameter bei Q4 — keine Desktop-GPU-Geschwindigkeit erwarten.
- ▸Bester Einsatz: ein privater Dauer-Assistent, Hausautomation oder Offline-Experimente — kein schneller Alltags-Chatbot.
Wichtigste Punkte
- ✓Ja — der Raspberry Pi 5 mit 8 GB betreibt 1B-3B-Modelle über Ollama oder llama.cpp allein auf der CPU
- ✓Der offizielle Raspberry Pi AI HAT+ 2 bringt eine Hailo-10H-NPU speziell für On-Device-GenAI mit, inklusive eigenem Hailo-Ollama-Server
- ✓Kaufen Sie die 8-GB-Konfiguration — 4 GB lässt zu wenig Reserve für Modell plus Betriebssystem
- ✓Aktive Kühlung lohnt sich bei jeder dauerhaften Inferenz-Last, nicht nur bei kurzen Tests
- ✓Bester Einsatz: ein privater Dauer-Assistent, Hausautomation oder Offline-Experimente — kein schneller Alltags-Chatbot
- ✓Für ernsthafte 7B+-Arbeit mit lokalen LLMs schlägt jeder GPU-PC oder Mini-PC jede Pi-5-Konfiguration
Budget-Setup: Nur der Raspberry Pi 5
Ein nackter Raspberry Pi 5 (8 GB) betreibt 1B-3B-Parameter-Modelle bei Q4-Quantisierung über Ollama oder llama.cpp — Modelle wie Llama 3.2 1B, Llama 3.2 3B oder Qwen3 1.7B. Alles läuft auf der Quad-Core-CPU: Die integrierte VideoCore-GPU des Pi 5 ist kein praxistauglicher llama.cpp-Beschleuniger, es gibt also keinen nennenswerten GPU-Vorteil auf dem nackten Board.
Community-Benchmarks setzen kleine Q4-Modelle bei etwa 4-9 Tokens pro Sekunde auf der Pi-5-CPU an, je nach Modell und Laufzeitumgebung — spürbar langsamer als Desktop-GPU-Inferenz, aber nutzbar für kurze Anfragen und lockeres Experimentieren.
Am besten für: Offline-Assistenten für einfache Anfragen, Home-Assistant-Experimente, Automatisierungsskripte und zum Lernen, wie lokale Inferenz funktioniert. Kaufen Sie die 8-GB-Konfiguration — die 4-GB-Variante lässt zu wenig Reserve für Modell plus Raspberry Pi OS.
Besser: Pi 5 + Raspberry Pi AI HAT+ 2
Der offizielle Raspberry Pi AI HAT+ 2 macht aus einem Pi 5 ein zweckgebautes Edge-AI-System, indem er eine Hailo-10H-NPU und 8 GB dedizierten Speicher hinzufügt. Die eigene Dokumentation von Raspberry Pi bestätigt GenAI-/LLM-Unterstützung über einen Hailo-GenAI-Model-Zoo, inklusive eines Hailo-Ollama-Servers, den Sie über das Netzwerk oder eine browserbasierte Chat-Oberfläche ansprechen können.
Der Hailo-10H liefert 40 TOPS INT4-Inferenzleistung und bringt mehrere einsatzbereite kleine Modelle mit (etwa 1B-1,5B Parameter, darunter Qwen2- und Llama-3.2-Varianten) — ein spürbar anderer, schnellerer Weg als reine CPU-Inferenz für alle, die ein echtes Edge-AI-Gerät statt eines Hobby-Experiments wollen.
Kaufen Sie dieses Setup, wenn Sie dedizierte GenAI-Beschleunigung wollen und mit einem noch reifenden Software-Stack leben können — Raspberry Pi brachte den AI HAT+ 2 im Januar 2026 auf den Markt, und die dokumentierte Paketversion kann hinter Hailos eigenem Release-Rhythmus zurückliegen.
Pi 5 vs. Pi 5 + AI HAT+ 2 vs. GPU-PC
Der AI HAT+ 2 verkleinert den Abstand zu einer GPU, aber eine diskrete GPU oder ein GPU-PC gewinnt weiterhin bei Modellgröße und Geschwindigkeit.
| Setup | Lokale-AI-Fähigkeit | Am besten für |
|---|---|---|
| Nur Pi 5 | 1B-3B-Modelle, nur CPU | Günstigstes Experiment, Lernen |
| Pi 5 + AI HAT+ 2 | Dedizierte NPU, 1B-1,5B GenAI-Modelle | Echtes Edge-AI-Gerät, GenAI-Fokus |
| GPU-PC / Mini-PC | 7B+-Modelle, deutlich schneller | Ernsthafte tägliche Nutzung lokaler LLMs |
Kühlung für Dauerbetrieb
Anhaltend CPU- oder NPU-lastige Inferenz erwärmt den Pi stärker als gelegentliche Nutzung — der offizielle Raspberry Pi Active Cooler (ein aufsteckbarer Kühlkörper mit temperaturgesteuertem Lüfter) ist eine günstige, gut dokumentierte Ergänzung, wenn Sie Inferenz über längere Zeiträume statt nur kurze Tests planen.
NVMe-Speicher für den Dauerbetrieb
Wird der Pi zu einem dauerhaft laufenden lokalen KI-Server, ist NVMe-Speicher über das offizielle Raspberry Pi M.2 HAT+ (das die PCIe-Schnittstelle des Pi 5 nutzt) unter anhaltender Lese-/Schreiblast zuverlässiger als eine microSD-Karte — lohnenswert, sobald Sie über gelegentliches Testen hinausgehen.
Was kann man wirklich damit bauen?
Ein lokales LLM-Setup auf dem Pi 5 eignet sich für private Assistenten-Experimente, Hausautomation-Integrationen (siehe unseren Leitfaden zum Bau eines lokalen Sprachassistenten für realistische Latenzerwartungen auf Pi-Klasse-Hardware), einfache Dokumentenklassifikation und dauerhaft laufende Offline-Dienste, die keine schnellen Antworten brauchen.
Fazit
Am günstigsten: ein nackter Pi 5 8 GB für 1B-3B-Modelle und Experimente. Bestes Pi-basiertes AI-Setup: Pi 5 + der offizielle AI HAT+ 2 für dedizierte Hailo-10H-Beschleunigung. Beste Gesamtleistung: ein GPU-PC oder ein Mini-PC für lokale LLMs — für 7B+-Modelle kommt keine Pi-Konfiguration auch nur annähernd mit.
Weiterführende Artikel
- ▸Bestes lokales LLM für 6 GB VRAM — eine wirklich praktische Low-Budget-GPU-Alternative
- ▸Wie viel RAM braucht ein 7B-Modell? — warum 7B für eine Pi-5-CPU außer Reichweite ist
- ▸Bester Mini-PC für einen dauerhaft laufenden Ollama-Server — eine praktischere, dauerhaft laufende Alternative
- ▸Einen lokalen Sprachassistenten bauen — realistische Latenz über Pi-, Mini-PC- und GPU-Hardwarestufen hinweg
Häufig gestellte Fragen
Braucht der Raspberry Pi 5 aktive Kühlung für LLM-Inferenz?▾
Unterstützt der Raspberry Pi AI HAT+ 2 wirklich LLMs?▾
Ist Ollama der beste Weg, ein LLM auf einem Raspberry Pi 5 zu betreiben?▾
Ist ein Raspberry Pi 5 gut für einen Sprachassistenten mit lokalem LLM?▾
Was ist das minimale RAM für ein lokales LLM auf einem Pi 5?▾
Verwandte Prompt Bites