Skip to main content
PromptQuorumBuilt for humans. Structured for AI.

Kann man Qwen 3 mit Ollama ausführen?

Kann man Qwen 3 mit Ollama ausführen?

Schnelle Antwort

Ja — Ollama unterstützt alle Qwen 3-Modellgrößen von 0,6B bis 32B sowie die 30B-A3B-MoE-Variante. Starten Sie jede Größe mit ollama run qwen3:8b. Das 8B-Modell benötigt bei Q4 ~6 GB VRAM.

  • ▸ollama run qwen3:0.6b — passt in 1 GB VRAM
  • ▸ollama run qwen3:8b — benötigt ~6 GB VRAM
  • ▸ollama run qwen3:32b — benötigt ~21 GB VRAM
Ollama

Wichtigste Punkte

  • ✓Ollama unterstützt alle Qwen 3-Größen: 0,6B, 1,7B, 4B, 8B, 14B und 32B sowie die 30B-A3B-MoE-Variante
  • ✓Laden Sie jede Größe mit <code>ollama run qwen3:8b</code> — ersetzen Sie den Tag durch Ihre Zielgröße
  • ✓Das 8B-Modell benötigt ~6 GB VRAM bei Q4 und läuft mit ~20 tok/s auf einer Mid-Range-GPU
  • ✓Qwen 3 unterstützt Tool Calling nativ über die Standard-Ollama-API — kein benutzerdefiniertes Modelfile erforderlich

Ja — das ist verfügbar

Ollama unterstützt alle wichtigen Qwen 3-Modellgrößen von 0,6B bis 32B sowie die 30B-A3B-MoE-Variante. Laden Sie jede Größe mit einem einzigen Befehl: ollama run qwen3:8b. Ersetzen Sie 8b durch 0.6b, 1.7b, 4b, 14b, 32b oder 30b-a3b für andere Größen.

Jede Größe ist in mehreren Quantisierungsstufen verfügbar. Q4_K_M ist die Standardeinstellung und empfohlene Ausgangsstufe — sie bietet das beste Verhältnis aus Qualität und Dateigröße. Q8_0 ist für 8B und 14B verfügbar, wenn Sie VRAM-Spielraum haben.

Tool Calling wird nativ für alle Qwen 3-Größen über die Standard-Ollama-API unterstützt. Es ist kein benutzerdefiniertes Modelfile oder spezielles Prompt-Template erforderlich.

ollama run qwen3:8b

Die richtige Qwen 3-Größe wählen

Die richtige Qwen 3-Größe hängt vollständig vom verfügbaren VRAM ab. Für die meisten Nutzer mit einer Mid-Range-GPU (6–8 GB VRAM) ist das 8B-Modell bei Q4_K_M die praktische Wahl — es benötigt ~6 GB und läuft mit ~20 tok/s.

Das 14B-Modell bei Q4 ist die empfohlene Stufe für Programmieraufgaben: Es übertrifft das 8B-Modell bei der Code-Generierung und passt bequem in 10–12 GB VRAM. Einen vollständigen Vergleich der Qwen 3-Coding-Performance gegenüber anderen lokalen Modellen finden Sie im Leitfaden zum lokalen Ausführen von Qwen im Jahr 2026.

VRAMQwen 3-GrößeGeeignet für
< 4 GB0,6B / 1,7BEdge-Geräte, Tests, CPU-only
4–6 GB4BBudget-GPU oder CPU mit wenig RAM
6–12 GB8B / 14BAllgemeine Nutzung und Coding
12–24 GB32B / 30B-A3B (MoE)Hochwertiges Coding und Reasoning

Schnelle Antworten zu Qwen 3 auf Ollama

Wie installiere ich Qwen 3 auf Ollama?▾
Führen Sie ollama run qwen3:8b in einem Terminal aus. Ollama lädt das Modell beim ersten Start automatisch herunter. Ersetzen Sie 8b durch Ihre Zielgröße: 0.6b, 1.7b, 4b, 14b, 32b oder 30b-a3b.
Ist Qwen 3 besser als Llama 3 für Coding?▾
Für Coding: Ja, Qwen3 14B übertrifft Llama 3 8B bei HumanEval-Benchmarks. Für allgemeine Unterhaltung auf 8B-Niveau bleibt Llama 3 8B wettbewerbsfähig. Die aktuellen Top-Ollama-Empfehlungen für alle Aufgaben finden Sie unter den besten Ollama-Modellen aktuell.
Unterstützt Qwen 3 Tool Calling auf Ollama?▾
Ja. Qwen 3 unterstützt Function- und Tool Calling nativ über die Standard-Ollama-API. Es ist kein benutzerdefiniertes Modelfile oder spezielle Konfiguration erforderlich — es funktioniert mit jedem Client, der das Ollama-Tool-Use-Format unterstützt.
Welches ist das größte Qwen 3-Modell, das ich lokal ausführen kann?▾
Das größte dichte Qwen 3-Modell ist 32B, das ~21 GB VRAM bei Q4 benötigt — es passt auf eine einzelne RTX 3090 oder RTX 4090. Für schnellere Inferenz bei ähnlicher Qualität benötigt die 30B-A3B-MoE-Variante nur ~19 GB VRAM und läuft spürbar schneller, da pro Token nur ein Bruchteil der Parameter aktiviert wird. Apple M-series Macs mit 32+ GB Unified Memory führen beide Varianten problemlos aus.