Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/SwiftLM im Test: Nativer Swift-MLX-Inferenzserver für Apple Silicon
Mobile & Edge LLMs

SwiftLM im Test: Nativer Swift-MLX-Inferenzserver für Apple Silicon

·11 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

SwiftLM ist ein kostenloser, quelloffener (MIT-lizenzierter) Inferenzserver, nativ in Swift geschrieben, der MLX-Modelle auf Apple-Silicon-Macs über eine strikt OpenAI-kompatible API ausführt – ganz ohne Python-Laufzeitumgebung, GIL oder zusätzliche Speicherkopien. Entwickelt von SharpAI (Quellcode unter github.com/SharpAI/SwiftLM), kompiliert es zu einer einzigen eigenständigen Binärdatei, unterstützt Modelle mit Vision- und Audioeingabe und wird mit SwiftBuddy ausgeliefert, einer iOS/iPadOS-Begleit-App, die MLX-Modelle direkt auf iPhone oder iPad ausführt. Voraussetzung ist macOS 14.0 oder neuer auf Apple Silicon (M1 bis M5); es gibt keinen Build für Windows, Linux oder Intel-Macs.

SwiftLM (github.com/SharpAI/SwiftLM) ist ein kostenloser, quelloffener, nativ in Swift geschriebener Inferenzserver, der MLX-Modelle auf Apple Silicon über eine strikt OpenAI-kompatible API ausführt – ganz ohne Python-Laufzeitumgebung. Entwickelt wird er von SharpAI, einem Unternehmen aus dem Silicon Valley, das sonst vor allem für den Einsatz von maschinellem Lernen in CCTV- und NVR-Überwachungssystemen bekannt ist. Ausgeliefert wird SwiftLM zusammen mit einer iOS/iPadOS-Begleit-App namens SwiftBuddy für vollständig geräteinternen Chat. Dieser Test behandelt, was SwiftLM tatsächlich leistet, wie es sich mit Python-basierten MLX-Servern und mit Ollama vergleicht, wie die Installation abläuft und für wen es geeignet ist.

Wichtigste Erkenntnisse

  • SwiftLM (github.com/SharpAI/SwiftLM) ist ein kostenloser, quelloffener, nativer Swift-Inferenzserver für MLX-Modelle – keine IDE, kein Python-Paket
  • MIT-lizenziert, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys
  • Nur macOS 14.0+ auf Apple Silicon (M1 bis M5), laut dem Requirements-Abschnitt des Repositorys – keine Unterstützung für Windows, Linux oder Intel-Mac
  • Entwickelt von SharpAI, einer Organisation aus dem Silicon Valley, deren GitHub-Profil das Kerngeschäft als Anwendung von maschinellem Lernen auf traditionelle CCTV/NVR-Überwachungskameras beschreibt
  • Stellt eine strikt OpenAI-kompatible API bereit (/v1/chat/completions, /v1/models, /health), sodass bestehender OpenAI-Client-Code direkt darauf zeigen kann
  • Unterstützt Vision-Language-Modelle (über --vision) und, für ausgewählte Gemma-4-Varianten, Audio-Language-Eingabe (über --audio)
  • Enthält SSD-Expertenstreaming für übergroße Mixture-of-Experts-Modelle sowie TurboQuant-KV-Cache-Kompression für Inferenz mit langem Kontext
  • Enthält SwiftBuddy, eine kostenlose, quelloffene iOS/iPadOS-Begleit-App, die MLX-Modelle von HuggingFace herunterlädt und geräteintern ausführt
  • 768 GitHub-Stars und 53 Forks zum Zeitpunkt dieses Tests (18.09.2026); Repository erstellt am 21. März 2026, mit Releases, die in den Wochen vor diesem Test etwa alle 1–2 Tage erschienen

📍 In einem Satz

SwiftLM ist ein kostenloser, quelloffener (MIT) nativer Swift-Inferenzserver für Apple Silicon, der MLX-Modelle über eine strikt OpenAI-kompatible API bereitstellt, ganz ohne Python-Laufzeitumgebung, und mit einer iOS/iPadOS-Begleit-App namens SwiftBuddy ausgeliefert wird.

💬 In einfachen Worten

SwiftLM ist ein Kommandozeilenprogramm, das auf einem Mac mit Apple Silicon läuft, ein KI-Modell lädt und anderen Apps erlaubt, damit genauso zu kommunizieren wie mit den Servern von OpenAI – nur läuft hier alles auf dem eigenen Gerät, direkt zu nativem Metal-Code kompiliert statt über Python. Eine Begleit-App für iPhone/iPad namens SwiftBuddy macht etwas Ähnliches direkt auf dem Telefon.

📌Hinweis: Dieser Test ist die ausführliche Ergänzung zum SwiftLM-Eintrag im Local LLM Software Directory – dort finden sich alle lokalen KI-Tools im schnellen Vergleich. Grundlage sind SwiftLMs eigenes GitHub-Repository, README und Release-Historie, nicht unabhängige PromptQuorum-Benchmarks der von SharpAI veröffentlichten Leistungswerte.

Was ist SwiftLM?

SwiftLM ist ein vollständig in Swift geschriebener Inferenzserver, der MLX-Modelle lädt und über eine strikt OpenAI-kompatible HTTP-API bereitstellt – eine native Alternative zu Python-basierten Servern wie mlx-lm. Die eigene GitHub-Beschreibung fasst es als „Native MLX Swift LLM inference server for Apple Silicon“ zusammen, und es kompiliert zu einer einzigen eigenständigen Binärdatei, statt eine Python-Umgebung, einen virtuellen-Umgebungs-Manager oder einen Paketinstaller vorauszusetzen.

  • Kernfunktion: ein lokaler HTTP-Server, der jeweils ein MLX-Modell lädt und über OpenAI-kompatible Chat-Completion-Endpunkte bereitstellt
  • Implementierungssprache: Swift, kompiliert mit Metal-Kerneln für GPU-Berechnungen – kein Python und kein Global Interpreter Lock (GIL), der gleichzeitige Anfragen ausbremst
  • Entwickler: SharpAI, eine Organisation aus dem Silicon Valley, seit Februar 2018 auf GitHub, deren eigenes Profil die Hauptarbeit als Bringen von maschinellem Lernen zu traditionellen CCTV/NVR-Überwachungskameras beschreibt
  • Zugrunde liegendes Framework: Apples MLX-Array-Framework, über eigene Forks (SharpAI/mlx, SharpAI/mlx-c), die Out-of-Core-, Memory-Mapped-Ausführung hinzufügen, die laut SharpAI in den offiziellen ml-explore-Repositorys noch nicht verfügbar ist
  • Lizenz: MIT, bestätigt über die Lizenz-Metadaten des Repositorys
  • Größe: 768 GitHub-Stars, 53 Forks und 12 Mitwirkende zum Zeitpunkt dieses Tests

Wer entwickelt SwiftLM, und wie schnell geht es voran?

SwiftLM ist ein junges, sich schnell entwickelndes Projekt: Das GitHub-Repository wurde am 21. März 2026 erstellt, und bis zum Veröffentlichungsdatum dieses Tests erschienen in den vorangegangenen Wochen etwa alle ein bis zwei Tage getaggte Releases.

  • Repository erstellt: 21. März 2026 – zum Zeitpunkt dieses Tests rund sechs Monate alt
  • Aktuelle Release-Taktung: Die getaggten Builds b703 bis b711 erschienen zwischen dem 27. August 2026 und dem 5. September 2026, im Schnitt etwa ein Release alle 1,4 Tage in diesem Zeitraum
  • Organisation: SharpAI, im Februar 2018 auf GitHub gegründet, laut eigenem GitHub-Profil mit Sitz im Silicon Valley
  • Hauptgeschäft: Laut SharpAIs eigenem GitHub-Profil liegt der Hauptfokus der Organisation darin, "traditionelle CCTV/NVR- und Überwachungskameras mit Technologien des maschinellen Lernens auszustatten" – SwiftLM selbst ist kein Überwachungsprodukt, sondern ein universeller Inferenzserver, den SharpAI quelloffen bereitgestellt hat
  • Mitwirkende: 12 zum Zeitpunkt dieses Tests, darunter ausgewiesene technische Arbeit an SSD-Expertenstreaming und TurboQuant-KV-Cache-Kompression
  • Eigene MLX-Forks: SharpAI pflegt SharpAI/mlx und SharpAI/mlx-c, Forks von Apples offiziellem MLX-Framework, um Out-of-Core-Memory-Mapped-Ausführung zu unterstützen, die laut README im Upstream-Projekt noch nicht verfügbar ist

Was kann man mit SwiftLM tun?

Der Funktionsumfang von SwiftLM zielt darauf ab, MLX-Modelle auf Apple Silicon so schnell und speichereffizient wie möglich bereitzustellen, mit mehreren Funktionen speziell für Modelle, die zu groß für bequemen Platz im Unified Memory sind. Hier ist, was jeder Teil laut SwiftLMs eigenem GitHub-README tut.

  • OpenAI-kompatible Bereitstellung — stellt die Endpunkte /v1/chat/completions, /v1/models und /health bereit, sodass bestehende OpenAI-Client-SDKs und -Tools SwiftLM als Drop-in-lokales Backend nutzen können
  • Breite Modellfamilien-Unterstützung — laut README werden nativ über 30 Modellfamilien unterstützt, darunter Gemma 4/3, Qwen 3.5/3/2.5, Llama 3.x, Mistral/Mixtral, Phi 4/3, DeepSeek V3, GLM 4, Falcon H1 sowie mehrere kleinere Forschungsfamilien
  • Vision-Language-Modelle (VLM) — laufen mit dem Flag --vision und unterstützen Echtzeit-Base64-Bildparsing für Modelle wie Qwen2-VL, Qwen2.5-VL und PaliGemma
  • Audio-Language-Modelle (ALM) — laufen mit dem Flag --audio für ausgewählte Gemma-4-"Omni"-Varianten und dekodieren OpenAI-Spec-input_audio-Payloads über AVFoundation-WAV-Extraktion
  • TurboQuant-KV-Cache-Kompression — ein eigenes, nichtlineares (Lloyd-Max-Codebook) 3-Bit-Klassen-Quantisierungsschema für den Attention-KV-Cache, das laut SharpAIs eigenen Benchmarks rund 3,5-mal kleiner ist als FP16 bei nahezu keinem Genauigkeitsverlust, aktivierbar mit --turbo-kv
  • SSD-Expertenstreaming — streamt bei Mixture-of-Experts-Modellen inaktive Expertenschichten von der NVMe-SSD, statt das vollständige Modell im RAM zu benötigen, aktivierbar mit --stream-experts; SharpAIs eigene Tests umfassen Modelle bis 69,6 GB (Qwen3.5-122B-A10B) und 209 GB (Qwen3.5-397B-A22B) auf einem 64-GB-Mac
  • Spekulatives Decoding und Multi-Token Prediction (MTP) — beschleunigt die Inferenz im RAM entweder über ein separates kleines Draft-Modell (--draft-model) oder, bei Modellen mit nativen MTP-Köpfen wie der Qwen3-Familie, ganz ohne ein solches
  • Feingranulare Speichersteuerung — Flags wie --gpu-layers und --prefill-size erlauben es, einzustellen, wie viel eines Modells auf der GPU liegt und wie Prompts beim Prefill segmentiert werden

Anwendungsbeispiele: Drei Wege, SwiftLM zu nutzen

Dies sind konkrete Workflows, die auf SwiftLMs dokumentierten Flags und Endpunkten oben aufbauen – keine hypothetischen Anwendungsfälle.

SwiftLM Preise und Lizenzierung

SwiftLM ist kostenlos, ohne jede kostenpflichtige Stufe. Sowohl SwiftLM als auch die Begleit-App SwiftBuddy sind MIT-lizenziert, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys – eine freizügige Open-Source-Lizenz ohne Attributionspflicht über den Erhalt des Copyright-Hinweises hinaus und ohne Copyleft-Verpflichtungen.

  • Kein Abonnement, keine kostenpflichtige Stufe, keine von SwiftLM selbst auferlegten Nutzungsgrenzen
  • Kein Konto oder Registrierung nötig, um den Server oder die SwiftBuddy-App auszuführen
  • Die MIT-Lizenz gilt für das gesamte Repository, einschließlich SwiftBuddy, laut den Lizenz-Metadaten des GitHub-Repositorys
  • Die einzigen echten Kosten sind Hardware: SwiftLM benötigt einen Apple-Silicon-Mac mit macOS 14.0 oder neuer – es läuft nicht auf Intel-Macs, Windows oder Linux

SwiftLM vs. Ollama

SwiftLM und Ollama führen beide offene Modelle lokal hinter einer OpenAI-kompatiblen API aus, setzen aber unterschiedliche Prioritäten — Ollama optimiert auf breite Hardware-Unterstützung und ein großes bestehendes Ökosystem, während SwiftLM eng auf maximale Apple-Silicon-Performance und Effizienz bei langem Kontext optimiert.

Aspekt
SwiftLM
Ollama
EngineNativ in Swift, kompiliert zu Metal via MLXGo-Wrapper um einen llama.cpp/GGML-C++-Kern
PlattformenmacOS 14+, nur Apple Silicon, plus iOS-Begleit-AppmacOS, Windows, Linux, Docker; Intel und Apple Silicon
Laufzeit-AbhängigkeitKeine — eine einzige native Binärdatei, kein PythonKeine — ebenfalls eine einzige native Binärdatei, kein Python
ModellformatHuggingFace-Safetensors via MLX (mlx-community-Builds)GGUF über eigene Modellbibliothek und Modelfile-System
KV-Kompression für langen KontextTurboQuant, ~3,5x kleiner als FP16 (--turbo-kv)Kein dediziertes KV-Kompressions-Flag zum Zeitpunkt dieses Tests
Übergroße MoE-ModelleSSD-Expertenstreaming führt MoE-Modelle über 100 Mrd. Parameter über RAM-Grenzen hinweg ausNutzt Standard-OS-Memory-Mapping, kein dedizierter Streaming-Modus
Reifegrad768 GitHub-Stars, Repository erstellt März 2026Etabliertes Projekt mit deutlich größerer Installationsbasis und Ökosystem

Dieser Vergleich spiegelt öffentlich dokumentierte Funktionen aus den jeweiligen GitHub-Repositorys wider, nicht unabhängige PromptQuorum-Benchmarks der tatsächlichen Durchsatzleistung eines der beiden Tools. Wer plattformübergreifende Unterstützung (Windows oder Linux) oder das größte bestehende Ökosystem an Integrationen braucht, ist mit Ollama besser bedient; wer nur Apple Silicon nutzt und native Swift-Performance sowie Speichereinsparungen bei langem Kontext ausreizen will, sollte SwiftLM direkt prüfen.

Für wen eignet sich SwiftLM?

Ob SwiftLM passt, hängt stark von der eigenen Hardware ab — es läuft nur auf Apple Silicon — sowie davon, wie sehr native Swift-Performance und Speichereffizienz bei langem Kontext gegenüber Ökosystem-Reife gewichtet werden.

Konkurrenten und Alternativen

SwiftLM bewegt sich in einem kleinen, aber wachsenden Feld nativer, Python-freier MLX-Inferenzserver für Apple Silicon — hier ein Vergleich mit anderen Tools in diesem Segment sowie der Python-Referenzimplementierung, gegen die es sich selbst positioniert.

Tool
Bekannt für
Link
oMLXMLX-Inferenzserver mit nativer macOS-Menüleisten-App und gestuftem RAM+SSD-KV-CacheoMLX Test
Rapid-MLXNativer MLX-Inferenzserver, der zusätzlich Bild-, Video- und Audiogenerierung lokal bereitstelltRapid-MLX Test
vLLM (MLX-Backend)Inferenzserver mit hohem Durchsatz, mit optionalem MLX-Backend für Apple SiliconvLLM MLX Test
mlx-lmApples eigene Python-Referenzbibliothek zum Ausführen von LLMs auf MLXmlx-lm erklärt

Dies ist keine vollständige Liste aller Apple-Silicon-Inferenz-Tools — das Local LLM Software Directory enthält den vollständigen, regelmäßig aktualisierten Katalog, einschließlich SwiftLMs eigenem Verzeichniseintrag.

Häufige Fehler bei der Bewertung von SwiftLM

Die meisten Missverständnisse zu SwiftLM entstehen, weil es mit unabhängigen, ähnlich benannten Projekten verwechselt wird oder weil angenommen wird, es laufe auf Hardware, die es ausdrücklich nicht unterstützt.

Häufig gestellte Fragen

Was ist SwiftLM?

SwiftLM (github.com/SharpAI/SwiftLM) ist ein kostenloser, quelloffener (MIT), nativer Swift-Inferenzserver, der MLX-Modelle auf Apple-Silicon-Macs über eine strikt OpenAI-kompatible API ausführt, ganz ohne Python-Laufzeitumgebung.

Ist SwiftLM kostenlos?

Ja. SwiftLM und die Begleit-App SwiftBuddy sind beide kostenlos und MIT-lizenziert, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys. Es gibt keine Preisseite, kein Konto und keine kostenpflichtige Stufe.

Welche Systemanforderungen hat SwiftLM?

Laut dem eigenen Requirements-Abschnitt des Repositorys: macOS 14.0 oder neuer, ein Apple-Silicon-Mac (M1 bis M5), die Xcode Command Line Tools und die Metal Toolchain. Es gibt keinen Build für Windows, Linux oder Intel-Mac.

Wie installiere ich SwiftLM?

Eine vorgefertigte macOS-arm64-Binärdatei von der GitHub-Releases-Seite des Projekts herunterladen und direkt ausführen, oder das Repository klonen und ./build.sh ausführen, um aus dem Quellcode zu bauen, laut offiziellem README.

Was ist SwiftBuddy?

SwiftBuddy ist SwiftLMs kostenlose, quelloffene Begleit-App für iPhone und iPad, die MLX-Modelle von HuggingFace herunterlädt und sie direkt geräteintern über MLX Swift ausführt. Ihr Quellcode liegt innerhalb des SwiftLM-Repositorys; sie wird über Xcode gebaut und ausgeführt statt über den App Store vertrieben, Stand dieses Tests.

Unterstützt SwiftLM Vision- oder Audioeingabe?

Ja. Der Start von SwiftLM mit dem Flag --vision aktiviert Vision-Language-Modelle wie Qwen2-VL und PaliGemma, und das Flag --audio aktiviert Audioeingabe für ausgewählte Gemma-4-"Omni"-Varianten, laut offiziellem README.

Was ist TurboQuant?

TurboQuant ist SwiftLMs eigenes KV-Cache-Kompressionsschema, das nichtlineare Lloyd-Max-Codebooks mit einer hardwarebeschleunigten Metal-Implementierung kombiniert. SharpAIs eigene Benchmarks geben an, dass es den KV-Cache auf rund 3,5-mal kleiner als FP16 komprimiert, bei nahezu keinem Genauigkeitsverlust, aktivierbar mit dem Flag --turbo-kv.

Was ist SSD-Expertenstreaming?

Es ist eine Funktion, die inaktive Mixture-of-Experts-Schichten direkt von der NVMe-SSD zur GPU streamt, statt das vollständige Modell im Unified Memory vorzuhalten, aktivierbar mit --stream-experts. SharpAIs eigene Tests umfassen Modelle bis 209 GB auf einem 64-GB-Mac.

Wer entwickelt SwiftLM?

SwiftLM wird von SharpAI entwickelt, einer Organisation aus dem Silicon Valley, seit 2018 auf GitHub, deren erklärtes Hauptgeschäft die Anwendung von maschinellem Lernen auf CCTV/NVR-Überwachungssysteme ist. SwiftLM ist ein universeller Inferenzserver, den die Organisation getrennt von diesem Kerngeschäft quelloffen bereitgestellt hat.

Wie schneidet SwiftLM im Vergleich zu Ollama ab?

Beide stellen lokale Modelle hinter einer OpenAI-kompatiblen API bereit, aber Ollama unterstützt macOS, Windows und Linux mit einem deutlich größeren Ökosystem, während SwiftLM nur auf Apple Silicon läuft und MLX-native Funktionen wie TurboQuant-KV-Kompression und SSD-Expertenstreaming für übergroße MoE-Modelle bietet. Siehe den ausführlichen Vergleich SwiftLM vs. Ollama oben.

Hat PromptQuorum SwiftLMs Leistungsangaben unabhängig getestet?

Dieser Test basiert auf SwiftLMs eigenem GitHub-Repository, README und Release-Historie, nicht auf unabhängigen PromptQuorum-Benchmarks der von SharpAI veröffentlichten Leistungswerte.

Quellen

← Zurück zu Lokale LLMs Pro