Wichtigste Erkenntnisse
- SwiftLM (github.com/SharpAI/SwiftLM) ist ein kostenloser, quelloffener, nativer Swift-Inferenzserver für MLX-Modelle – keine IDE, kein Python-Paket
- MIT-lizenziert, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys
- Nur macOS 14.0+ auf Apple Silicon (M1 bis M5), laut dem Requirements-Abschnitt des Repositorys – keine Unterstützung für Windows, Linux oder Intel-Mac
- Entwickelt von SharpAI, einer Organisation aus dem Silicon Valley, deren GitHub-Profil das Kerngeschäft als Anwendung von maschinellem Lernen auf traditionelle CCTV/NVR-Überwachungskameras beschreibt
- Stellt eine strikt OpenAI-kompatible API bereit (
/v1/chat/completions,/v1/models,/health), sodass bestehender OpenAI-Client-Code direkt darauf zeigen kann - Unterstützt Vision-Language-Modelle (über
--vision) und, für ausgewählte Gemma-4-Varianten, Audio-Language-Eingabe (über--audio) - Enthält SSD-Expertenstreaming für übergroße Mixture-of-Experts-Modelle sowie TurboQuant-KV-Cache-Kompression für Inferenz mit langem Kontext
- Enthält SwiftBuddy, eine kostenlose, quelloffene iOS/iPadOS-Begleit-App, die MLX-Modelle von HuggingFace herunterlädt und geräteintern ausführt
- 768 GitHub-Stars und 53 Forks zum Zeitpunkt dieses Tests (18.09.2026); Repository erstellt am 21. März 2026, mit Releases, die in den Wochen vor diesem Test etwa alle 1–2 Tage erschienen
📍 In einem Satz
SwiftLM ist ein kostenloser, quelloffener (MIT) nativer Swift-Inferenzserver für Apple Silicon, der MLX-Modelle über eine strikt OpenAI-kompatible API bereitstellt, ganz ohne Python-Laufzeitumgebung, und mit einer iOS/iPadOS-Begleit-App namens SwiftBuddy ausgeliefert wird.
💬 In einfachen Worten
SwiftLM ist ein Kommandozeilenprogramm, das auf einem Mac mit Apple Silicon läuft, ein KI-Modell lädt und anderen Apps erlaubt, damit genauso zu kommunizieren wie mit den Servern von OpenAI – nur läuft hier alles auf dem eigenen Gerät, direkt zu nativem Metal-Code kompiliert statt über Python. Eine Begleit-App für iPhone/iPad namens SwiftBuddy macht etwas Ähnliches direkt auf dem Telefon.
📌Hinweis: Dieser Test ist die ausführliche Ergänzung zum SwiftLM-Eintrag im Local LLM Software Directory – dort finden sich alle lokalen KI-Tools im schnellen Vergleich. Grundlage sind SwiftLMs eigenes GitHub-Repository, README und Release-Historie, nicht unabhängige PromptQuorum-Benchmarks der von SharpAI veröffentlichten Leistungswerte.
Was ist SwiftLM?
SwiftLM ist ein vollständig in Swift geschriebener Inferenzserver, der MLX-Modelle lädt und über eine strikt OpenAI-kompatible HTTP-API bereitstellt – eine native Alternative zu Python-basierten Servern wie mlx-lm. Die eigene GitHub-Beschreibung fasst es als „Native MLX Swift LLM inference server for Apple Silicon“ zusammen, und es kompiliert zu einer einzigen eigenständigen Binärdatei, statt eine Python-Umgebung, einen virtuellen-Umgebungs-Manager oder einen Paketinstaller vorauszusetzen.
- Kernfunktion: ein lokaler HTTP-Server, der jeweils ein MLX-Modell lädt und über OpenAI-kompatible Chat-Completion-Endpunkte bereitstellt
- Implementierungssprache: Swift, kompiliert mit Metal-Kerneln für GPU-Berechnungen – kein Python und kein Global Interpreter Lock (GIL), der gleichzeitige Anfragen ausbremst
- Entwickler: SharpAI, eine Organisation aus dem Silicon Valley, seit Februar 2018 auf GitHub, deren eigenes Profil die Hauptarbeit als Bringen von maschinellem Lernen zu traditionellen CCTV/NVR-Überwachungskameras beschreibt
- Zugrunde liegendes Framework: Apples MLX-Array-Framework, über eigene Forks (
SharpAI/mlx,SharpAI/mlx-c), die Out-of-Core-, Memory-Mapped-Ausführung hinzufügen, die laut SharpAI in den offiziellenml-explore-Repositorys noch nicht verfügbar ist - Lizenz: MIT, bestätigt über die Lizenz-Metadaten des Repositorys
- Größe: 768 GitHub-Stars, 53 Forks und 12 Mitwirkende zum Zeitpunkt dieses Tests
Wer entwickelt SwiftLM, und wie schnell geht es voran?
SwiftLM ist ein junges, sich schnell entwickelndes Projekt: Das GitHub-Repository wurde am 21. März 2026 erstellt, und bis zum Veröffentlichungsdatum dieses Tests erschienen in den vorangegangenen Wochen etwa alle ein bis zwei Tage getaggte Releases.
- Repository erstellt: 21. März 2026 – zum Zeitpunkt dieses Tests rund sechs Monate alt
- Aktuelle Release-Taktung: Die getaggten Builds b703 bis b711 erschienen zwischen dem 27. August 2026 und dem 5. September 2026, im Schnitt etwa ein Release alle 1,4 Tage in diesem Zeitraum
- Organisation: SharpAI, im Februar 2018 auf GitHub gegründet, laut eigenem GitHub-Profil mit Sitz im Silicon Valley
- Hauptgeschäft: Laut SharpAIs eigenem GitHub-Profil liegt der Hauptfokus der Organisation darin, "traditionelle CCTV/NVR- und Überwachungskameras mit Technologien des maschinellen Lernens auszustatten" – SwiftLM selbst ist kein Überwachungsprodukt, sondern ein universeller Inferenzserver, den SharpAI quelloffen bereitgestellt hat
- Mitwirkende: 12 zum Zeitpunkt dieses Tests, darunter ausgewiesene technische Arbeit an SSD-Expertenstreaming und TurboQuant-KV-Cache-Kompression
- Eigene MLX-Forks: SharpAI pflegt
SharpAI/mlxundSharpAI/mlx-c, Forks von Apples offiziellem MLX-Framework, um Out-of-Core-Memory-Mapped-Ausführung zu unterstützen, die laut README im Upstream-Projekt noch nicht verfügbar ist
Was kann man mit SwiftLM tun?
Der Funktionsumfang von SwiftLM zielt darauf ab, MLX-Modelle auf Apple Silicon so schnell und speichereffizient wie möglich bereitzustellen, mit mehreren Funktionen speziell für Modelle, die zu groß für bequemen Platz im Unified Memory sind. Hier ist, was jeder Teil laut SwiftLMs eigenem GitHub-README tut.
- OpenAI-kompatible Bereitstellung — stellt die Endpunkte
/v1/chat/completions,/v1/modelsund/healthbereit, sodass bestehende OpenAI-Client-SDKs und -Tools SwiftLM als Drop-in-lokales Backend nutzen können - Breite Modellfamilien-Unterstützung — laut README werden nativ über 30 Modellfamilien unterstützt, darunter Gemma 4/3, Qwen 3.5/3/2.5, Llama 3.x, Mistral/Mixtral, Phi 4/3, DeepSeek V3, GLM 4, Falcon H1 sowie mehrere kleinere Forschungsfamilien
- Vision-Language-Modelle (VLM) — laufen mit dem Flag
--visionund unterstützen Echtzeit-Base64-Bildparsing für Modelle wie Qwen2-VL, Qwen2.5-VL und PaliGemma - Audio-Language-Modelle (ALM) — laufen mit dem Flag
--audiofür ausgewählte Gemma-4-"Omni"-Varianten und dekodieren OpenAI-Spec-input_audio-Payloads über AVFoundation-WAV-Extraktion - TurboQuant-KV-Cache-Kompression — ein eigenes, nichtlineares (Lloyd-Max-Codebook) 3-Bit-Klassen-Quantisierungsschema für den Attention-KV-Cache, das laut SharpAIs eigenen Benchmarks rund 3,5-mal kleiner ist als FP16 bei nahezu keinem Genauigkeitsverlust, aktivierbar mit
--turbo-kv - SSD-Expertenstreaming — streamt bei Mixture-of-Experts-Modellen inaktive Expertenschichten von der NVMe-SSD, statt das vollständige Modell im RAM zu benötigen, aktivierbar mit
--stream-experts; SharpAIs eigene Tests umfassen Modelle bis 69,6 GB (Qwen3.5-122B-A10B) und 209 GB (Qwen3.5-397B-A22B) auf einem 64-GB-Mac - Spekulatives Decoding und Multi-Token Prediction (MTP) — beschleunigt die Inferenz im RAM entweder über ein separates kleines Draft-Modell (
--draft-model) oder, bei Modellen mit nativen MTP-Köpfen wie der Qwen3-Familie, ganz ohne ein solches - Feingranulare Speichersteuerung — Flags wie
--gpu-layersund--prefill-sizeerlauben es, einzustellen, wie viel eines Modells auf der GPU liegt und wie Prompts beim Prefill segmentiert werden
Anwendungsbeispiele: Drei Wege, SwiftLM zu nutzen
Dies sind konkrete Workflows, die auf SwiftLMs dokumentierten Flags und Endpunkten oben aufbauen – keine hypothetischen Anwendungsfälle.
SwiftLM installieren
Die Installation von SwiftLM ist kostenlos, entweder als vorgefertigte macOS-Binärdatei oder selbst aus dem Quellcode gebaut, und der Quellcode – plus der Quellcode der SwiftBuddy-iOS-App – liegt auf GitHub.
Quelle | Link |
|---|---|
| GitHub-Repository (Quellcode, MIT-Lizenz) | github.com/SharpAI/SwiftLM |
| Vorgefertigte macOS-arm64-Binärdatei | Releases-Seite |
Aus dem Quellcode bauen (./build.sh) | Anleitung „Build from Source" |
| SwiftBuddy-iOS/iPadOS-App-Quellcode (Build in Xcode) | SwiftBuddy-Verzeichnis |
| MLX-Modelle | huggingface.co/mlx-community |
Laut dem Requirements-Abschnitt des Repositorys benötigt SwiftLM macOS 14.0+ auf Apple Silicon (M1–M5), die Xcode Command Line Tools und die Metal Toolchain (installierbar über xcodebuild -downloadComponent MetalToolchain). SwiftBuddy wird zum Zeitpunkt dieses Tests nicht über den App Store vertrieben – zum Bauen sind Xcode und ein eigenes Apple-Developer-Konto nötig, da das .xcodeproj in .gitignore liegt und lokal über generate_xcodeproj.py neu erzeugt wird.
SwiftLM Preise und Lizenzierung
SwiftLM ist kostenlos, ohne jede kostenpflichtige Stufe. Sowohl SwiftLM als auch die Begleit-App SwiftBuddy sind MIT-lizenziert, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys – eine freizügige Open-Source-Lizenz ohne Attributionspflicht über den Erhalt des Copyright-Hinweises hinaus und ohne Copyleft-Verpflichtungen.
- Kein Abonnement, keine kostenpflichtige Stufe, keine von SwiftLM selbst auferlegten Nutzungsgrenzen
- Kein Konto oder Registrierung nötig, um den Server oder die SwiftBuddy-App auszuführen
- Die MIT-Lizenz gilt für das gesamte Repository, einschließlich SwiftBuddy, laut den Lizenz-Metadaten des GitHub-Repositorys
- Die einzigen echten Kosten sind Hardware: SwiftLM benötigt einen Apple-Silicon-Mac mit macOS 14.0 oder neuer – es läuft nicht auf Intel-Macs, Windows oder Linux
SwiftLM vs. Ollama
SwiftLM und Ollama führen beide offene Modelle lokal hinter einer OpenAI-kompatiblen API aus, setzen aber unterschiedliche Prioritäten — Ollama optimiert auf breite Hardware-Unterstützung und ein großes bestehendes Ökosystem, während SwiftLM eng auf maximale Apple-Silicon-Performance und Effizienz bei langem Kontext optimiert.
Aspekt | SwiftLM | Ollama |
|---|---|---|
| Engine | Nativ in Swift, kompiliert zu Metal via MLX | Go-Wrapper um einen llama.cpp/GGML-C++-Kern |
| Plattformen | macOS 14+, nur Apple Silicon, plus iOS-Begleit-App | macOS, Windows, Linux, Docker; Intel und Apple Silicon |
| Laufzeit-Abhängigkeit | Keine — eine einzige native Binärdatei, kein Python | Keine — ebenfalls eine einzige native Binärdatei, kein Python |
| Modellformat | HuggingFace-Safetensors via MLX (mlx-community-Builds) | GGUF über eigene Modellbibliothek und Modelfile-System |
| KV-Kompression für langen Kontext | TurboQuant, ~3,5x kleiner als FP16 (--turbo-kv) | Kein dediziertes KV-Kompressions-Flag zum Zeitpunkt dieses Tests |
| Übergroße MoE-Modelle | SSD-Expertenstreaming führt MoE-Modelle über 100 Mrd. Parameter über RAM-Grenzen hinweg aus | Nutzt Standard-OS-Memory-Mapping, kein dedizierter Streaming-Modus |
| Reifegrad | 768 GitHub-Stars, Repository erstellt März 2026 | Etabliertes Projekt mit deutlich größerer Installationsbasis und Ökosystem |
Dieser Vergleich spiegelt öffentlich dokumentierte Funktionen aus den jeweiligen GitHub-Repositorys wider, nicht unabhängige PromptQuorum-Benchmarks der tatsächlichen Durchsatzleistung eines der beiden Tools. Wer plattformübergreifende Unterstützung (Windows oder Linux) oder das größte bestehende Ökosystem an Integrationen braucht, ist mit Ollama besser bedient; wer nur Apple Silicon nutzt und native Swift-Performance sowie Speichereinsparungen bei langem Kontext ausreizen will, sollte SwiftLM direkt prüfen.
Für wen eignet sich SwiftLM?
Ob SwiftLM passt, hängt stark von der eigenen Hardware ab — es läuft nur auf Apple Silicon — sowie davon, wie sehr native Swift-Performance und Speichereffizienz bei langem Kontext gegenüber Ökosystem-Reife gewichtet werden.
Konkurrenten und Alternativen
SwiftLM bewegt sich in einem kleinen, aber wachsenden Feld nativer, Python-freier MLX-Inferenzserver für Apple Silicon — hier ein Vergleich mit anderen Tools in diesem Segment sowie der Python-Referenzimplementierung, gegen die es sich selbst positioniert.
Tool | Bekannt für | Link |
|---|---|---|
| oMLX | MLX-Inferenzserver mit nativer macOS-Menüleisten-App und gestuftem RAM+SSD-KV-Cache | oMLX Test |
| Rapid-MLX | Nativer MLX-Inferenzserver, der zusätzlich Bild-, Video- und Audiogenerierung lokal bereitstellt | Rapid-MLX Test |
| vLLM (MLX-Backend) | Inferenzserver mit hohem Durchsatz, mit optionalem MLX-Backend für Apple Silicon | vLLM MLX Test |
| mlx-lm | Apples eigene Python-Referenzbibliothek zum Ausführen von LLMs auf MLX | mlx-lm erklärt |
Dies ist keine vollständige Liste aller Apple-Silicon-Inferenz-Tools — das Local LLM Software Directory enthält den vollständigen, regelmäßig aktualisierten Katalog, einschließlich SwiftLMs eigenem Verzeichniseintrag.
Häufige Fehler bei der Bewertung von SwiftLM
Die meisten Missverständnisse zu SwiftLM entstehen, weil es mit unabhängigen, ähnlich benannten Projekten verwechselt wird oder weil angenommen wird, es laufe auf Hardware, die es ausdrücklich nicht unterstützt.
Häufig gestellte Fragen
Was ist SwiftLM?
SwiftLM (github.com/SharpAI/SwiftLM) ist ein kostenloser, quelloffener (MIT), nativer Swift-Inferenzserver, der MLX-Modelle auf Apple-Silicon-Macs über eine strikt OpenAI-kompatible API ausführt, ganz ohne Python-Laufzeitumgebung.
Ist SwiftLM kostenlos?
Ja. SwiftLM und die Begleit-App SwiftBuddy sind beide kostenlos und MIT-lizenziert, bestätigt über die Lizenz-Metadaten des GitHub-Repositorys. Es gibt keine Preisseite, kein Konto und keine kostenpflichtige Stufe.
Welche Systemanforderungen hat SwiftLM?
Laut dem eigenen Requirements-Abschnitt des Repositorys: macOS 14.0 oder neuer, ein Apple-Silicon-Mac (M1 bis M5), die Xcode Command Line Tools und die Metal Toolchain. Es gibt keinen Build für Windows, Linux oder Intel-Mac.
Wie installiere ich SwiftLM?
Eine vorgefertigte macOS-arm64-Binärdatei von der GitHub-Releases-Seite des Projekts herunterladen und direkt ausführen, oder das Repository klonen und ./build.sh ausführen, um aus dem Quellcode zu bauen, laut offiziellem README.
Was ist SwiftBuddy?
SwiftBuddy ist SwiftLMs kostenlose, quelloffene Begleit-App für iPhone und iPad, die MLX-Modelle von HuggingFace herunterlädt und sie direkt geräteintern über MLX Swift ausführt. Ihr Quellcode liegt innerhalb des SwiftLM-Repositorys; sie wird über Xcode gebaut und ausgeführt statt über den App Store vertrieben, Stand dieses Tests.
Unterstützt SwiftLM Vision- oder Audioeingabe?
Ja. Der Start von SwiftLM mit dem Flag --vision aktiviert Vision-Language-Modelle wie Qwen2-VL und PaliGemma, und das Flag --audio aktiviert Audioeingabe für ausgewählte Gemma-4-"Omni"-Varianten, laut offiziellem README.
Was ist TurboQuant?
TurboQuant ist SwiftLMs eigenes KV-Cache-Kompressionsschema, das nichtlineare Lloyd-Max-Codebooks mit einer hardwarebeschleunigten Metal-Implementierung kombiniert. SharpAIs eigene Benchmarks geben an, dass es den KV-Cache auf rund 3,5-mal kleiner als FP16 komprimiert, bei nahezu keinem Genauigkeitsverlust, aktivierbar mit dem Flag --turbo-kv.
Was ist SSD-Expertenstreaming?
Es ist eine Funktion, die inaktive Mixture-of-Experts-Schichten direkt von der NVMe-SSD zur GPU streamt, statt das vollständige Modell im Unified Memory vorzuhalten, aktivierbar mit --stream-experts. SharpAIs eigene Tests umfassen Modelle bis 209 GB auf einem 64-GB-Mac.
Wer entwickelt SwiftLM?
SwiftLM wird von SharpAI entwickelt, einer Organisation aus dem Silicon Valley, seit 2018 auf GitHub, deren erklärtes Hauptgeschäft die Anwendung von maschinellem Lernen auf CCTV/NVR-Überwachungssysteme ist. SwiftLM ist ein universeller Inferenzserver, den die Organisation getrennt von diesem Kerngeschäft quelloffen bereitgestellt hat.
Wie schneidet SwiftLM im Vergleich zu Ollama ab?
Beide stellen lokale Modelle hinter einer OpenAI-kompatiblen API bereit, aber Ollama unterstützt macOS, Windows und Linux mit einem deutlich größeren Ökosystem, während SwiftLM nur auf Apple Silicon läuft und MLX-native Funktionen wie TurboQuant-KV-Kompression und SSD-Expertenstreaming für übergroße MoE-Modelle bietet. Siehe den ausführlichen Vergleich SwiftLM vs. Ollama oben.
Hat PromptQuorum SwiftLMs Leistungsangaben unabhängig getestet?
Dieser Test basiert auf SwiftLMs eigenem GitHub-Repository, README und Release-Historie, nicht auf unabhängigen PromptQuorum-Benchmarks der von SharpAI veröffentlichten Leistungswerte.