Wichtigste Erkenntnisse
- TurboFieldfare (github.com/drumih/turbo-fieldfare) ist eine kostenlose, quelloffene, native Swift/Metal-Laufzeitumgebung – kein Wrapper um llama.cpp oder MLX
- Apache-2.0-lizenziert, bestätigt über die LICENSE-Datei im GitHub-Repository
- Führt genau eine Modellfamilie aus: das instruction-getunte Gemma 4 26B-A4B (26 Mrd. Parameter insgesamt, ca. 3,88 Mrd. aktiv pro Token)
- Erreicht einen RAM-Bedarf von rund 2 GB, indem ein 1,35 GB großer gemeinsamer Kern plus ein 4K-Token-KV-Cache im Speicher gehalten und die übrigen Mixture-of-Experts-Gewichte per
pread-Aufrufen während der Generierung von der SSD gestreamt werden - Bringt drei Nutzungswege mit: eine native SwiftUI/AppKit-Mac-App, eine Kommandozeilen-Oberfläche (TurboFieldfareCLI) und einen experimentellen Loopback-OpenAI-kompatiblen Server (TurboFieldfareServer)
- Erfordert einen Apple-Silicon-Mac, macOS 26 mit Metal 4 sowie Xcode 26 mit Swift 6.2 oder neuer zum Bauen aus dem Quellcode – das Paket ist rein arm64
- Über 6.750 GitHub-Stars und 430+ Forks zum Zeitpunkt dieses Tests
📍 In einem Satz
TurboFieldfare ist eine kostenlose, quelloffene (Apache 2.0) native Swift-und-Metal-Laufzeitumgebung für Apple-Silicon-Macs mit über 6.750 GitHub-Stars, die Googles Gemma-4-26B-A4B-Modell mit rund 2 GB RAM ausführt, indem der Großteil der Mixture-of-Experts-Gewichte von der SSD gestreamt wird, statt das komplette 14,3-GB-Modell in den Speicher zu laden.
💬 In einfachen Worten
TurboFieldfare ist eine kostenlose App, die Sie aus dem Quellcode auf einem Mac mit Apple-Silicon-Chip bauen. Sie ermöglicht es, ein großes (26 Milliarden Parameter umfassendes) KI-Modell lokal auszuführen – sogar auf einem Mac mit nur 8 GB RAM –, weil jeweils nur ein kleiner "Kern" des Modells im Speicher gehalten und der Rest bei Bedarf von der Festplatte gelesen wird – keine Cloud, kein Abo, und kein anderes Modell außer Gemma 4 26B-A4B.
📌Hinweis: Dieser Test ist der ausführliche Begleitartikel zum Eintrag von TurboFieldfare im Local LLM Software Directory – dort finden Sie einen schnellen Vergleich von TurboFieldfare mit Dutzenden anderer lokaler KI-Tools.
Was ist TurboFieldfare?
TurboFieldfare ist eine modellspezifische lokale Inferenz-Laufzeitumgebung für Apple-Silicon-Macs, die entwickelt wurde, um ein einziges Modell – Gemma 4 26B-A4B – innerhalb eines strikten Speicherbudgets auszuführen, statt wie eine universelle Engine beliebige Modelle zu unterstützen. Das eigene GitHub-README beschreibt es unverblümt: "Gemma 4 26B-A4B Inferenz mit rund 2 GB RAM. Eine eigens entwickelte Swift-+-Metal-Laufzeitumgebung für jeden Apple-Silicon-Mac, sogar die 8-GB-Modelle."
- Produkttyp: eine native Swift/Metal-Laufzeitumgebung, CLI und Mac-App – laut eigenem README kein Wrapper um llama.cpp oder MLX
- Umfang: modellspezifisch, führt ausschließlich Gemma 4 26B-A4B (instruction-tuned) aus, keine Multi-Modell-Engine
- Repository: github.com/drumih/turbo-fieldfare, erstellt am 17. Juli 2026
- Lizenz: Apache 2.0 für den Quellcode; die Modellgewichte unterliegen Googles eigenen Gemma-Nutzungsbedingungen und werden separat von Hugging Face heruntergeladen
- Größe: über 6.750 GitHub-Stars, 430+ Forks und 26 offene Issues zum Zeitpunkt dieses Tests
- Abgrenzung: Es existieren mehrere nahezu identisch benannte Repositories mit ähnlicher Beschreibung unter anderen GitHub-Accounts; drumih/turbo-fieldfare ist das Original mit den meisten Stars und das hier besprochene Repository
Projektgeschichte und Versions-Meilensteine von TurboFieldfare
Das GitHub-Repository von TurboFieldfare wurde im Juli 2026 erstellt – ein vergleichsweise junges Projekt – und hat seither mehrere Releases veröffentlicht, zuletzt mit einer lokalen Gesprächsverlauf-Funktion in der Mac-App.
- 1Repository erstellt — 17. Juli 2026
Why it matters: Das kanonische GitHub-Repository von TurboFieldfare (drumih/turbo-fieldfare) wurde laut den Metadaten von GitHub angelegt. - 2v0.7.2 — vorheriges Release
Why it matters: Das Release unmittelbar vor v0.8.0, referenziert im Changelog-Vergleichslink dieses Releases. - 3v0.8.0 — 8. September 2026: Lokaler Gesprächsverlauf
Why it matters: Laut offiziellen Release Notes speichert die Mac-App seither Gesprächsverläufe lokal, sodass Nutzer frühere Chats – inklusive gespeicherter Texte und Bilder – über die Seitenleiste durchsuchen, umbenennen, löschen und erneut öffnen können. Dieses Release ist ausdrücklich als "nur Quellcode" markiert, ohne beigefügte fertige Binärdateien.
Was macht TurboFieldfare eigentlich?
Der Funktionsumfang von TurboFieldfare konzentriert sich darauf, genau ein großes Modell auf bescheidener Apple-Silicon-Hardware nutzbar zu machen. Hier ist, was jeder Teil laut eigenem GitHub-README und Dokumentation tatsächlich leistet.
- Streaming von Experten-Gewichten von der SSD — statt das komplette ~14,3 GB große Gemma-4-26B-A4B-Modell in den Speicher zu laden, hält TurboFieldfare einen 1,35 GB großen gemeinsamen Kern sowie einen FP16-Key-Value-Cache im Speicher und streamt nur die für jedes Token benötigten Mixture-of-Experts-Gewichte per
pread-Aufrufen von der Festplatte, mit einer LFU-Verdrängungsstrategie (least-frequently-used) für den SSD-gestützten Experten-Cache - Eigene Metal-Kernels — handgeschriebene Metal-Kernels übernehmen quantisiertes GEMV, Attention, Mixture-of-Experts-Routing, Normalisierung und Sampling, statt auf ein allgemeines ML-Framework zu setzen
- Chunked Prefill — laut Systemdesign-Dokumentation des Projekts reduziert eine chunked-Prefill-Strategie die Zeit bis zum ersten Token, während der Speicherverbrauch begrenzt bleibt
- Drei Oberflächen, ein Modell-Speicher — eine native Mac-App, eine Kommandozeilen-Oberfläche (TurboFieldfareCLI) und ein experimenteller Loopback-OpenAI-kompatibler Server (TurboFieldfareServer) greifen alle auf dasselbe
.gturbo-Modellverzeichnis zu, wobei jeweils nur ein modellbesitzender Prozess gleichzeitig laufen sollte - Optionaler Vision-Turm — Bildeingabe wird über ein separat installierbares Vision-Tower-Zusatzpaket (ca. 1,1 GB) unterstützt, das einen M2 oder neueren Mac voraussetzt; reine Textinferenz bleibt auf M1 verfügbar
- Keine Tool-Ausführung in App/CLI — die Mac-App und CLI unterstützen Nutzer-/Modellnachrichten sowie optionale Systemanweisungen, exponieren oder führen aber keine Tools aus; der Loopback-Server akzeptiert Function-Tool-Deklarationen und liefert vom Modell erzeugte Tool-Aufrufe zur Ausführung durch den Client zurück, laut README
- Nicht audio-/videofähig — laut eigener Dokumentation unterstützt TurboFieldfare keine Audio- oder Videoeingabe
Anwendungsbeispiele: Drei Wege, TurboFieldfare zu nutzen
Dies sind konkrete Workflows aus dem eigenen dokumentierten README von TurboFieldfare – keine hypothetischen Anwendungsfälle.
TurboFieldfare installieren
TurboFieldfare hat keinen fertigen Installer – Sie bauen es aus dem Quellcode mit dem Swift Package Manager, und der Quellcode liegt auf GitHub. Laut eigenem README lautet die Installationssequenz: git clone https://github.com/drumih/turbo-fieldfare.git, dann cd turbo-fieldfare, dann swift build -c release, dann .build/release/TurboFieldfareMac ausführen.
Quelle | Link |
|---|---|
| GitHub-Repository (Quellcode, Apache 2.0) | github.com/drumih/turbo-fieldfare |
| Systemdesign-Dokumentation (wie die Laufzeitumgebung funktioniert) | docs/SYSTEM_DESIGN.md |
| Benchmarks | docs/BENCHMARKS.md |
| Releases (mit Tags versehene Versionen) | github.com/drumih/turbo-fieldfare/releases |
Zum Bauen benötigen Sie einen Apple-Silicon-Mac mit macOS 26 und Metal 4 sowie Xcode 26 und Swift 6.2 oder neuer – das Paket ist rein arm64, Intel-Macs und andere Plattformen werden nicht unterstützt. Beim ersten Start lädt der Swift Package Manager benötigte Tokenizer-Pakete herunter und baut sie, anschließend lädt die App rund 15 GB an Modellgewichten herunter, bevor Sie Text generieren können; prüfen Sie die aktuellen Anforderungen direkt im Repository-README, da sie sich zwischen Releases ändern können.
TurboFieldfare-Preise: Ist TurboFieldfare wirklich kostenlos?
Ja – TurboFieldfare hat keine kostenpflichtige Stufe. Der Quellcode ist Apache-2.0-lizenziert und kostenlos zu bauen und auszuführen; es gibt kein Abo, kein Konto und keine Nutzungsgrenze seitens des Projekts.
- Kein Abo, keine kostenpflichtige Stufe, keine vom Projekt selbst auferlegten Nutzungsgrenzen
- Kein Konto und keine Anmeldung nötig, um App, CLI oder Server zu bauen oder auszuführen
- Die Gewichte von Gemma 4 26B-A4B werden einmalig von Hugging Face heruntergeladen und unterliegen Googles eigenen Gemma-Modellbedingungen, getrennt von der Apache-2.0-Quellcodelizenz von TurboFieldfare
- Die einzigen laufenden Kosten sind Ihre eigene Hardware und Ihr Speicherplatz: ca. 14,3 GB für das Textmodell, plus ca. 1,1 GB mehr, falls Sie den optionalen Bild-Vision-Turm installieren
TurboFieldfare vs. Ollama
TurboFieldfare und Ollama lösen unterschiedliche Probleme: Ollama ist ein universeller lokaler Modell-Runner, der einen großen, wachsenden Katalog offener Modelle unter macOS, Windows und Linux unterstützt, während TurboFieldfare eine Single-Modell-Laufzeitumgebung nur für Apple Silicon ist, optimiert darauf, Gemma 4 26B-A4B in rund 2 GB RAM unterzubringen.
Modellunterstützung
- TurboFieldfare vs. Ollama:
- TurboFieldfare führt nur Gemma 4 26B-A4B aus; Ollama unterstützt einen breiten, regelmäßig aktualisierten Katalog offener Modelle.
Plattform
- TurboFieldfare vs. Ollama:
- TurboFieldfare läuft nur unter Apple Silicon/macOS (arm64, macOS 26+); Ollama unterstützt macOS, Windows und Linux.
Installationsmethode
- TurboFieldfare vs. Ollama:
- TurboFieldfare wird über den Swift Package Manager aus dem Quellcode gebaut; Ollama liefert pro Plattform einen fertigen Installer bzw. ein fertiges Binary.
Speicheransatz
- TurboFieldfare vs. Ollama:
- TurboFieldfare streamt den Großteil der Experten-Gewichte von der SSD, um auf einen 8-GB-Mac zu passen; Ollama lädt Modelle entsprechend dem verfügbaren RAM/VRAM Ihrer Hardware und benötigt für ein vergleichbar großes Modell in der Regel mehr Speicher.
Engine-Basis
- TurboFieldfare vs. Ollama:
- TurboFieldfare ist eine eigene Swift/Metal-Laufzeitumgebung, nicht auf llama.cpp aufgebaut; Ollama basiert auf llama.cpp (GGML) als Inferenz-Kern.
Wenn Ihre Priorität darin besteht, genau ein großes Modell auf speicherbegrenzter Apple-Silicon-Hardware auszuführen, ist der enge Fokus von TurboFieldfare genau der Punkt. Wenn Ihre Priorität Flexibilität über viele Modelle und Plattformen hinweg ist, ist Ollama das breitere universelle Tool – siehe den Ollama-Test für Details. Prüfen Sie aktuelle Funktionsdetails direkt auf der jeweiligen Projektseite, bevor Sie sich entscheiden.
Für wen eignet sich TurboFieldfare?
Ob TurboFieldfare passt, hängt davon ab, ob Sie speziell Gemma 4 26B-A4B auf einem speicherbegrenzten Apple-Silicon-Mac ausführen möchten, statt einen universellen lokalen Modell-Runner zu benötigen.
Konkurrenten und Alternativen
TurboFieldfare wird im Bereich lokaler Inferenz-Engines am häufigsten mit Ollama und LMDeploy verglichen – sein Hauptunterscheidungsmerkmal ist, eine eng gefasste, modellspezifische Laufzeitumgebung zu sein statt einer universellen Engine mit Unterstützung für viele Modelle.
Tool | Am bekanntesten für | Link |
|---|---|---|
| Ollama | Universeller lokaler Modell-Runner mit großem Modellkatalog, macOS/Windows/Linux | Ollama-Test |
| LMDeploy | Toolkit zum Komprimieren, Bereitstellen und Servieren von LLMs, mit Fokus auf Inferenz-Durchsatz | LMDeploy-Test |
Diese Liste spiegelt Tools wider, die häufig mit TurboFieldfare verglichen werden, und ist kein unabhängiges Ranking von PromptQuorum – siehe das Local LLM Software Directory für den vollständigen, regelmäßig aktualisierten Katalog, einschließlich des eigenen Directory-Eintrags von TurboFieldfare. Prüfen Sie die aktuelle Plattform- und Modellunterstützung jedes Tools, bevor Sie sich entscheiden.
Häufige Fehler bei der Bewertung von TurboFieldfare
Die meisten Missverständnisse zu TurboFieldfare entstehen, weil Nutzer universelle Engine-Funktionen erwarten, die es bewusst nicht hat, oder ein anderes Repository unter demselben Namen annehmen.
Häufig gestellte Fragen
Was ist TurboFieldfare?
TurboFieldfare (github.com/drumih/turbo-fieldfare) ist eine kostenlose, quelloffene (Apache 2.0) native Swift-und-Metal-Laufzeitumgebung für Apple-Silicon-Macs, die Googles Gemma-4-26B-A4B-Modell mit rund 2 GB RAM ausführt.
Ist TurboFieldfare kostenlos?
Ja, der Quellcode von TurboFieldfare ist kostenlos und Apache-2.0-lizenziert, ohne kostenpflichtige Stufe. Die Gewichte von Gemma 4 26B-A4B werden separat von Hugging Face unter Googles eigenen Gemma-Modellbedingungen heruntergeladen.
Wie installiere ich TurboFieldfare?
Klonen Sie das Repository, führen Sie swift build -c release aus und starten Sie dann .build/release/TurboFieldfareMac. Es gibt keinen fertigen Installer – TurboFieldfare muss über den Swift Package Manager aus dem Quellcode gebaut werden.
Welche Modelle unterstützt TurboFieldfare?
Nur Gemma 4 26B-A4B (instruction-tuned). Es ist eine modellspezifische Laufzeitumgebung, keine universelle Engine mit Unterstützung für beliebige Modelle.
Wie führt TurboFieldfare ein 26B-Modell mit 2 GB RAM aus?
Es hält einen 1,35 GB großen gemeinsamen Kern und einen kleinen KV-Cache im Speicher und streamt die übrigen Mixture-of-Experts-Gewichte des Modells bei Bedarf während der Generierung von der SSD, mithilfe eigener Metal-Kernels und einer LFU-Verdrängungsstrategie für den SSD-gestützten Experten-Cache.
Welche Hardware benötigt TurboFieldfare?
Einen Apple-Silicon-Mac (M1 oder neuer für reinen Text; M2 oder neuer für den optionalen Vision-Turm), macOS 26 mit Metal 4 und rund 14,3 GB freien Speicher für das Textmodell. Zum Bauen benötigen Sie Xcode 26 und Swift 6.2 oder neuer.
Unterstützt TurboFieldfare Windows oder Linux?
Nein, das Paket ist rein arm64 und benötigt macOS 26 mit Metal 4 – es unterstützt weder Windows noch Linux noch Intel-basierte Macs.
Unterstützt TurboFieldfare Bilder?
Ja, über ein separat installierbares Vision-Tower-Zusatzpaket (ca. 1,1 GB), das einen M2 oder neueren Mac voraussetzt. Ohne dieses Paket funktioniert reine Textinferenz weiterhin, auch auf M1-Macs.
Unterstützt TurboFieldfare Tool-Calling?
Die native Mac-App und CLI exponieren oder führen keine Tools aus. Der experimentelle Loopback-OpenAI-kompatible Server akzeptiert Function-Tool-Deklarationen und liefert vom Modell erzeugte Tool-Aufrufe zur Ausführung durch Ihren Client-Code zurück.
Wie unterscheidet sich TurboFieldfare von Ollama?
TurboFieldfare führt über eine eigene Swift/Metal-Laufzeitumgebung nur Gemma 4 26B-A4B auf Apple-Silicon-Macs aus; Ollama ist ein universeller, plattformübergreifender Modell-Runner auf Basis von llama.cpp mit einem deutlich breiteren Modellkatalog. Siehe den Vergleich TurboFieldfare vs. Ollama oben.
Hat PromptQuorum die Angaben von TurboFieldfare unabhängig getestet?
Dieser Test basiert auf dem eigenen GitHub-Repository, README und der Dokumentation von TurboFieldfare, statt auf praktischen Benchmarks durch PromptQuorum.