Wichtigste Erkenntnisse
- Qwen 3.6 27B fuehrt: 92,1% HumanEval, 77,2% SWE-bench, 84,3% MBPP — hoechste Werte in allen drei Benchmarks lokal.
- DeepSeek Coder ist der Cloud-Kostensieger: 0,14 $/1M Token, 0,5 Prozentpunkte hinter Qwen bei HumanEval.
- Mistral Devstral glaenzt bei agentischen Aufgaben: besser bei mehrstufigem Tool-Einsatz und Multi-Datei-Refactoring.
- Dispatch-Strategie: private/DSGVO-Coding-Aufgaben → lokales Qwen 3.6, nicht-sensitive Massenverarbeitung → DeepSeek Coder API.
Häufig gestellte Fragen
Ist Qwen 3.6 27B besser als DeepSeek Coder für lokales Coding?
Für lokales Deployment: Qwen 3.6 27B erreicht 77,2% SWE-bench (verifiziert) und läuft vollständig lokal auf 16 GB VRAM, was es DSGVO-konform für EU-Teams macht. DeepSeek Coder ist eine Cloud-API mit Kosten von ~0,14 $/1M Input-Token — die bessere Wahl für nicht-sensitive Massen-Codegenerierung, wenn keine lokale Hardware verfügbar ist. Die Abwägung hängt von Datensensibilität und Budget ab, es gibt keinen einzelnen Gewinner.
Was ist Mistral Devstral und warum wird es hier erwähnt?
Mistral Devstral Small 24B ist ein Coding-fokussiertes Modell von Mistral AI, veröffentlicht im Mai 2026, das speziell für agentische Coding-Aufgaben entwickelt wurde — Multi-Datei-Refactoring, Tool-Einsatz und iterative Codegenerierung. Es erreicht 90,1% HumanEval und läuft auf 14 GB VRAM. Es ist besonders stark bei Aufgaben mit mehreren sequenziellen Code-Operationen, wo sein agentisches Training einen Vorteil gegenüber den reinen Benchmark-Werten von Qwen 3.6 27B bietet.
Kann ich Qwen 3.6 27B und Devstral 24B gleichzeitig ausführen?
Auf einer einzelnen RTX 4090 (24 GB VRAM) nein — Qwen 3.6 27B Q4_K_M nutzt ~15,8 GB und Devstral 24B Q4_K_M ~14,2 GB, zusammen ~30 GB. Erforderlich wäre ein Dual-GPU-Setup (zwei RTX 3090 oder zwei RTX 4090) oder Apple Silicon mit 96+ GB unified Memory. Die praktische Lösung ist, jeweils ein Modell zu nutzen und über Ollama zu wechseln, was auf einer RTX 4090 ~5 Sekunden dauert.
Ist DeepSeek Coder sicher für EU-Unternehmenscode?
DeepSeek Coder verarbeitet Daten auf Servern von DeepSeek AI, einem in China eingetragenen Unternehmen. Die EU-Kommission hat für China keinen Angemessenheitsbeschluss erlassen. Die Nutzung von DeepSeek Coder mit personenbezogenen EU-Daten oder proprietärem Quellcode mit personenbezogenen Informationen erfordert eine rechtliche Prüfung der Konformität mit Artikel 44 DSGVO. Für proprietären Code ohne personenbezogene Daten konsultieren Sie Ihr Rechtsteam. Für die Verarbeitung personenbezogener Daten ist lokales Qwen 3.6 27B die konforme Alternative.
Was ist SWE-bench und warum liegt der Fokus darauf?
SWE-bench (Software Engineering Benchmark) testet, ob ein LLM reale GitHub-Issues in Open-Source-Codebasen wie Django, Flask und NumPy lösen kann. Es misst praktische Softwareentwicklungsfähigkeit statt isolierter Funktions-Codierung. Qwen 3.6 27B erreicht 77,2% auf SWE-bench Verified, der derzeit zuverlässigsten Metrik für reale Coding-Aufgaben.
