Skip to main content
PromptQuorum

Bester Mini-PC für Ollama-Server im Dauerbetrieb (2026)

Bester Mini-PC für Ollama-Server im Dauerbetrieb (2026)

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Hardware & PerformanceFortgeschritten

Wichtigste Punkte

  • Mini-PCs verbrauchen 15–45 W statt 200–350 W für Desktop-GPUs — 24/7-Einsparungen sind erheblich
  • UM890 Pro läuft 7B-Modelle nur per CPU mit 12–18 Tok/s — gut für API-Server
  • AOOSTAR GEM12 Pro + OCuLink-eGPU ermöglicht GPU-Beschleunigung ohne Desktop-PC
  • Mac Mini M4 Pro: 48 GB Unified Memory läuft 32B-Modelle — beste macOS-Option
  • Beelink SER8 ist der Einstieg unter 400 € mit 32 GB RAM für 7B und 13B

Beste Mini-PCs für Ollama-Server im Dauerbetrieb — Ranking

1

Minisforum UM890 Pro — Bestes Gesamtpaket

Der Minisforum UM890 Pro läuft mit dem AMD Ryzen 9 8945HS (8-Kerne, bis 5,2 GHz) und unterstützt bis zu 96 GB DDR5-5600 Dual-Channel-RAM — genug, um Llama 3.3 70B bei Q4 vollständig in RAM zu laden. Die Radeon 780M iGPU (12 RDNA3-CUs) beschleunigt 7B- und 13B-Modelle auf 8–14 Tok/s via ROCm. CPU-only 7B Q4: ~12–18 Tok/s. Idle: ~15 W. Last (GPU aktiv): ~35–45 W. Preis: ~470 € (32 GB/1 TB) bis 570 € (64 GB).

Minisforum UM890 Pro bei Amazon.deProduktlink · offengelegt
2

AOOSTAR GEM12 Pro OCuLink — Beste eGPU-Option

Der AOOSTAR GEM12 Pro OCuLink hat einen OCuLink-Port, der eine externe GPU mit PCIe 4.0 x4-Bandbreite (64 Gbps) verbindet — genug für volle RTX-3090-Geschwindigkeit in Ollama. Ohne eGPU: wie andere Mini-PCs, 13–18 Tok/s CPU-only. Mit RTX 3090 eGPU: 60–80 Tok/s bei 7B Q4. OCuLink-auf-PCIe-Adapter benötigt (~28 €). Preis Barebone: ~360 €; mit 32 GB/1 TB: ~450 €.

AOOSTAR GEM12 Pro OCuLink bei Amazon.deProduktlink · offengelegt
3

Beelink SER8 — Bestes Budget-Angebot

Der Beelink SER8 läuft mit dem AMD Ryzen 7 8745HS (8-Kerne, bis 4,9 GHz), 32 GB DDR5 und 1 TB NVMe-SSD für ~420 €. Ollama-Geschwindigkeit: ~10–15 Tok/s bei 7B Q4. Idle: 10–15 W. RAM nachrüstbar (nicht verlötet bei aktueller 8745HS-Revision). Als solider Einstieg in Always-On-Ollama ohne 500+ € deckt der SER8 7B- und 13B-Modelle gut ab.

Beelink SER8 bei Amazon.deProduktlink · offengelegt
4

Apple Mac Mini M4 Pro — Bester macOS-Mini-PC

Der Mac Mini M4 Pro (24-Kerne-GPU, 48 GB Unified Memory, ~1399 €) ist der einzige Mini-PC, der 32B-Modelle mit GPU-Geschwindigkeit von Haus aus ausführt. Ollama auf Apple Silicon nutzt Metal — die 48 GB Unified Memory lädt Qwen3 32B Q4 (~18 GB) und läuft mit 20–30 Tok/s. Stromaufnahme: 18–30 W unter Ollama-Last. Ideal für macOS-Nutzer, die einen stillen, dauerhaft laufenden Heimserver möchten.

Apple Mac Mini M4 Pro bei Amazon.deProduktlink · offengelegt

Quick Answers

Kann ein Mini-PC 13B- oder größere Modelle in nutzbarer Geschwindigkeit ausführen?
Ja — mit genug RAM. Der UM890 Pro mit 64 GB läuft Llama 3.3 13B Q8 vollständig im RAM mit ~8–12 Tok/s CPU-only. Mit der Radeon 780M iGPU laufen Q4-Modelle mit 10–18 Tok/s — nutzbar für Hintergrund-Zusammenfassungen oder API-Aufrufe. Für 30B+-Modelle ist der Mac Mini M4 Pro (48 GB Unified Memory) die einzige Mini-PC-Option unter 1500 €.
Funktioniert Ollama gut als Netzwerkserver auf einem Mini-PC?
Ja. OLLAMA_HOST=0.0.0.0 setzen, und Ollama beantwortet Anfragen von allen Geräten im LAN. Mit Open WebUI (Docker-Container) gibt es eine Browser-Oberfläche für Smartphones, Tablets und PCs. Der Mini-PC hat niedrigen Stromverbrauch, läuft lautlos und verarbeitet eine gleichzeitige Anfrage problemlos.
Lohnen sich eGPU-Setups mit einem Mini-PC?
Für Ollama speziell ist ein OCuLink-eGPU (AOOSTAR GEM12 Pro + RTX-3090-Gehäuse) das Beste aus beiden Welten: Desktop-GPU-Geschwindigkeit bei Mini-PC-Stromverbrauch im Leerlauf. OCuLink (PCIe 4.0 x4) liefert ~80% der Bandbreite eines direkten PCIe x16-Slots — ausreichend für LLM-Inferenz. Thunderbolt-eGPUs sind langsamer (~40% Bandbreite) und für GPU-intensive Inferenz nicht empfohlen.

Den vollständigen Überblick?

Die vollständige Anleitung lesen →