Skip to main content
PromptQuorum

Kann man ein lokales LLM auf einem Raspberry Pi 5 betreiben?

Kann man ein lokales LLM auf einem Raspberry Pi 5 betreiben?

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Raspberry Pi 5 8GB Preis prüfenProduktlink · offengelegtRaspberry Pi AI HAT+ 2 Preis prüfenProduktlink · offengelegt

Schnelle Antwort

Ja. Der Pi 5 (8 GB) betreibt 1B-3B-Modelle über Ollama oder llama.cpp allein auf der CPU — das ist etwa die praktische Obergrenze. Mit dem offiziellen Raspberry Pi AI HAT+ 2 (Hailo-10H-NPU) gibt es dedizierte GenAI-Beschleunigung, einen eigenen Hailo-Ollama-Server und Spielraum für größere Modelle.

  • Bestes Budget-Setup: Pi 5 8 GB + aktive Kühlung — der günstigste Weg, mit winzigen Modellen zu experimentieren.
  • Bestes AI-Setup: Pi 5 + Raspberry Pi AI HAT+ 2 — eine dedizierte Hailo-10H-NPU speziell für GenAI-Workloads.
  • Modellbereich nur mit Pi 5: etwa 1B-3B Parameter bei Q4 — keine Desktop-GPU-Geschwindigkeit erwarten.
  • Bester Einsatz: ein privater Dauer-Assistent, Hausautomation oder Offline-Experimente — kein schneller Alltags-Chatbot.
Quick AnswersFortgeschritten

Wichtigste Punkte

  • Ja — der Raspberry Pi 5 mit 8 GB betreibt 1B-3B-Modelle über Ollama oder llama.cpp allein auf der CPU
  • Der offizielle Raspberry Pi AI HAT+ 2 bringt eine Hailo-10H-NPU speziell für On-Device-GenAI mit, inklusive eigenem Hailo-Ollama-Server
  • Kaufen Sie die 8-GB-Konfiguration — 4 GB lässt zu wenig Reserve für Modell plus Betriebssystem
  • Aktive Kühlung lohnt sich bei jeder dauerhaften Inferenz-Last, nicht nur bei kurzen Tests
  • Bester Einsatz: ein privater Dauer-Assistent, Hausautomation oder Offline-Experimente — kein schneller Alltags-Chatbot
  • Für ernsthafte 7B+-Arbeit mit lokalen LLMs schlägt jeder GPU-PC oder Mini-PC jede Pi-5-Konfiguration

Budget-Setup: Nur der Raspberry Pi 5

Ein nackter Raspberry Pi 5 (8 GB) betreibt 1B-3B-Parameter-Modelle bei Q4-Quantisierung über Ollama oder llama.cpp — Modelle wie Llama 3.2 1B, Llama 3.2 3B oder Qwen3 1.7B. Alles läuft auf der Quad-Core-CPU: Die integrierte VideoCore-GPU des Pi 5 ist kein praxistauglicher llama.cpp-Beschleuniger, es gibt also keinen nennenswerten GPU-Vorteil auf dem nackten Board.

Community-Benchmarks setzen kleine Q4-Modelle bei etwa 4-9 Tokens pro Sekunde auf der Pi-5-CPU an, je nach Modell und Laufzeitumgebung — spürbar langsamer als Desktop-GPU-Inferenz, aber nutzbar für kurze Anfragen und lockeres Experimentieren.

Am besten für: Offline-Assistenten für einfache Anfragen, Home-Assistant-Experimente, Automatisierungsskripte und zum Lernen, wie lokale Inferenz funktioniert. Kaufen Sie die 8-GB-Konfiguration — die 4-GB-Variante lässt zu wenig Reserve für Modell plus Raspberry Pi OS.

Raspberry Pi 5 8GB Preis prüfenProduktlink · offengelegt

Besser: Pi 5 + Raspberry Pi AI HAT+ 2

Der offizielle Raspberry Pi AI HAT+ 2 macht aus einem Pi 5 ein zweckgebautes Edge-AI-System, indem er eine Hailo-10H-NPU und 8 GB dedizierten Speicher hinzufügt. Die eigene Dokumentation von Raspberry Pi bestätigt GenAI-/LLM-Unterstützung über einen Hailo-GenAI-Model-Zoo, inklusive eines Hailo-Ollama-Servers, den Sie über das Netzwerk oder eine browserbasierte Chat-Oberfläche ansprechen können.

Der Hailo-10H liefert 40 TOPS INT4-Inferenzleistung und bringt mehrere einsatzbereite kleine Modelle mit (etwa 1B-1,5B Parameter, darunter Qwen2- und Llama-3.2-Varianten) — ein spürbar anderer, schnellerer Weg als reine CPU-Inferenz für alle, die ein echtes Edge-AI-Gerät statt eines Hobby-Experiments wollen.

Kaufen Sie dieses Setup, wenn Sie dedizierte GenAI-Beschleunigung wollen und mit einem noch reifenden Software-Stack leben können — Raspberry Pi brachte den AI HAT+ 2 im Januar 2026 auf den Markt, und die dokumentierte Paketversion kann hinter Hailos eigenem Release-Rhythmus zurückliegen.

Raspberry Pi AI HAT+ 2 Preis prüfenProduktlink · offengelegt

Pi 5 vs. Pi 5 + AI HAT+ 2 vs. GPU-PC

Der AI HAT+ 2 verkleinert den Abstand zu einer GPU, aber eine diskrete GPU oder ein GPU-PC gewinnt weiterhin bei Modellgröße und Geschwindigkeit.

SetupLokale-AI-FähigkeitAm besten für
Nur Pi 51B-3B-Modelle, nur CPUGünstigstes Experiment, Lernen
Pi 5 + AI HAT+ 2Dedizierte NPU, 1B-1,5B GenAI-ModelleEchtes Edge-AI-Gerät, GenAI-Fokus
GPU-PC / Mini-PC7B+-Modelle, deutlich schnellerErnsthafte tägliche Nutzung lokaler LLMs

Kühlung für Dauerbetrieb

Anhaltend CPU- oder NPU-lastige Inferenz erwärmt den Pi stärker als gelegentliche Nutzung — der offizielle Raspberry Pi Active Cooler (ein aufsteckbarer Kühlkörper mit temperaturgesteuertem Lüfter) ist eine günstige, gut dokumentierte Ergänzung, wenn Sie Inferenz über längere Zeiträume statt nur kurze Tests planen.

NVMe-Speicher für den Dauerbetrieb

Wird der Pi zu einem dauerhaft laufenden lokalen KI-Server, ist NVMe-Speicher über das offizielle Raspberry Pi M.2 HAT+ (das die PCIe-Schnittstelle des Pi 5 nutzt) unter anhaltender Lese-/Schreiblast zuverlässiger als eine microSD-Karte — lohnenswert, sobald Sie über gelegentliches Testen hinausgehen.

Raspberry Pi M.2 HAT+ Preis prüfenProduktlink · offengelegt

Was kann man wirklich damit bauen?

Ein lokales LLM-Setup auf dem Pi 5 eignet sich für private Assistenten-Experimente, Hausautomation-Integrationen (siehe unseren Leitfaden zum Bau eines lokalen Sprachassistenten für realistische Latenzerwartungen auf Pi-Klasse-Hardware), einfache Dokumentenklassifikation und dauerhaft laufende Offline-Dienste, die keine schnellen Antworten brauchen.

Fazit

Am günstigsten: ein nackter Pi 5 8 GB für 1B-3B-Modelle und Experimente. Bestes Pi-basiertes AI-Setup: Pi 5 + der offizielle AI HAT+ 2 für dedizierte Hailo-10H-Beschleunigung. Beste Gesamtleistung: ein GPU-PC oder ein Mini-PC für lokale LLMs — für 7B+-Modelle kommt keine Pi-Konfiguration auch nur annähernd mit.

Weiterführende Artikel

Häufig gestellte Fragen

Braucht der Raspberry Pi 5 aktive Kühlung für LLM-Inferenz?
Ja, bei anhaltender Last. Anhaltend CPU- oder NPU-lastige Workloads wie LLM-Inferenz erwärmen den Pi 5 stärker als gelegentliche Nutzung — der offizielle Active Cooler ist eine günstige, sinnvolle Ergänzung für längere Inferenz-Sitzungen.
Unterstützt der Raspberry Pi AI HAT+ 2 wirklich LLMs?
Ja — bestätigt durch die eigene Dokumentation von Raspberry Pi. Die Hailo-10H-NPU des AI HAT+ 2 betreibt eine dokumentierte Auswahl kleiner Modelle (etwa 1B-1,5B Parameter) über ein Hailo-GenAI-Model-Zoo-Paket und einen Hailo-Ollama-Server, erreichbar per API oder browserbasierter Chat-Oberfläche.
Ist Ollama der beste Weg, ein LLM auf einem Raspberry Pi 5 zu betreiben?
Ollama ist die einfachste Option für reine CPU-Inferenz auf dem nackten Pi 5. llama.cpp gibt mehr manuelle Kontrolle über Quantisierung und Build-Flags. Der AI HAT+ 2 nutzt einen eigenen, separaten Hailo-Ollama-Server statt des Standard-Ollama-CPU-Pfads.
Ist ein Raspberry Pi 5 gut für einen Sprachassistenten mit lokalem LLM?
Nur mit einem sehr kleinen Modell und realistischen Latenzerwartungen — siehe unseren Leitfaden zum Bau eines lokalen Sprachassistenten, der den reinen CPU-Pi-5-Betrieb als eine von mehreren Hardware-Stufen neben schnelleren Mini-PC-, GPU- und Mac-Optionen behandelt.
Was ist das minimale RAM für ein lokales LLM auf einem Pi 5?
Die 8-GB-Konfiguration ist das praktische Minimum für ein komfortables Erlebnis. Die 4-GB-Konfiguration kann technisch ein 1B-Modell laden, lässt aber sehr wenig Reserve für alles andere, was auf dem Gerät läuft.