Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/TurboFieldfare im Test: Gemma 4 26B-A4B mit 2 GB RAM ausführen
Overview & Reference

TurboFieldfare im Test: Gemma 4 26B-A4B mit 2 GB RAM ausführen

·11 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

TurboFieldfare ist eine kostenlose, quelloffene (Apache 2.0) native Swift-und-Metal-Laufzeitumgebung für Apple-Silicon-Macs, die Googles Gemma-4-26B-A4B-Modell mit rund 2 GB RAM ausführt, indem nur ein 1,35 GB großer gemeinsamer Kern samt KV-Cache im Speicher gehalten wird und die übrigen Experten des Modells bei Bedarf von der SSD nachgeladen werden. Es bringt eine native Mac-App, eine Kommandozeilen-Oberfläche und einen experimentellen lokalen OpenAI-kompatiblen Server mit, alle aus dem Quellcode über den Swift Package Manager gebaut – es gibt keinen fertigen Installer, und es ist modellspezifisch auf Gemma 4 26B-A4B zugeschnitten statt ein universelles Engine wie llama.cpp oder Ollama zu sein.

TurboFieldfare (github.com/drumih/turbo-fieldfare) ist eine kostenlose, quelloffene (Apache 2.0) native Swift-und-Metal-Laufzeitumgebung, die gezielt entwickelt wurde, um Googles Gemma 4 26B-A4B auf Apple-Silicon-Macs auszuführen – auch auf 8-GB-Geräten – bei einem Speicherbedarf von rund 2 GB RAM zur Inferenzzeit, mit über 6.750 GitHub-Stars. Dieser Test behandelt, was TurboFieldfare leistet, wie es diesen geringen Speicherbedarf erreicht, wie man es baut und installiert, und für wen es geeignet ist.

Wichtigste Erkenntnisse

  • TurboFieldfare (github.com/drumih/turbo-fieldfare) ist eine kostenlose, quelloffene, native Swift/Metal-Laufzeitumgebung – kein Wrapper um llama.cpp oder MLX
  • Apache-2.0-lizenziert, bestätigt über die LICENSE-Datei im GitHub-Repository
  • Führt genau eine Modellfamilie aus: das instruction-getunte Gemma 4 26B-A4B (26 Mrd. Parameter insgesamt, ca. 3,88 Mrd. aktiv pro Token)
  • Erreicht einen RAM-Bedarf von rund 2 GB, indem ein 1,35 GB großer gemeinsamer Kern plus ein 4K-Token-KV-Cache im Speicher gehalten und die übrigen Mixture-of-Experts-Gewichte per pread-Aufrufen während der Generierung von der SSD gestreamt werden
  • Bringt drei Nutzungswege mit: eine native SwiftUI/AppKit-Mac-App, eine Kommandozeilen-Oberfläche (TurboFieldfareCLI) und einen experimentellen Loopback-OpenAI-kompatiblen Server (TurboFieldfareServer)
  • Erfordert einen Apple-Silicon-Mac, macOS 26 mit Metal 4 sowie Xcode 26 mit Swift 6.2 oder neuer zum Bauen aus dem Quellcode – das Paket ist rein arm64
  • Über 6.750 GitHub-Stars und 430+ Forks zum Zeitpunkt dieses Tests

📍 In einem Satz

TurboFieldfare ist eine kostenlose, quelloffene (Apache 2.0) native Swift-und-Metal-Laufzeitumgebung für Apple-Silicon-Macs mit über 6.750 GitHub-Stars, die Googles Gemma-4-26B-A4B-Modell mit rund 2 GB RAM ausführt, indem der Großteil der Mixture-of-Experts-Gewichte von der SSD gestreamt wird, statt das komplette 14,3-GB-Modell in den Speicher zu laden.

💬 In einfachen Worten

TurboFieldfare ist eine kostenlose App, die Sie aus dem Quellcode auf einem Mac mit Apple-Silicon-Chip bauen. Sie ermöglicht es, ein großes (26 Milliarden Parameter umfassendes) KI-Modell lokal auszuführen – sogar auf einem Mac mit nur 8 GB RAM –, weil jeweils nur ein kleiner "Kern" des Modells im Speicher gehalten und der Rest bei Bedarf von der Festplatte gelesen wird – keine Cloud, kein Abo, und kein anderes Modell außer Gemma 4 26B-A4B.

📌Hinweis: Dieser Test ist der ausführliche Begleitartikel zum Eintrag von TurboFieldfare im Local LLM Software Directory – dort finden Sie einen schnellen Vergleich von TurboFieldfare mit Dutzenden anderer lokaler KI-Tools.

Was ist TurboFieldfare?

TurboFieldfare ist eine modellspezifische lokale Inferenz-Laufzeitumgebung für Apple-Silicon-Macs, die entwickelt wurde, um ein einziges Modell – Gemma 4 26B-A4B – innerhalb eines strikten Speicherbudgets auszuführen, statt wie eine universelle Engine beliebige Modelle zu unterstützen. Das eigene GitHub-README beschreibt es unverblümt: "Gemma 4 26B-A4B Inferenz mit rund 2 GB RAM. Eine eigens entwickelte Swift-+-Metal-Laufzeitumgebung für jeden Apple-Silicon-Mac, sogar die 8-GB-Modelle."

  • Produkttyp: eine native Swift/Metal-Laufzeitumgebung, CLI und Mac-App – laut eigenem README kein Wrapper um llama.cpp oder MLX
  • Umfang: modellspezifisch, führt ausschließlich Gemma 4 26B-A4B (instruction-tuned) aus, keine Multi-Modell-Engine
  • Repository: github.com/drumih/turbo-fieldfare, erstellt am 17. Juli 2026
  • Lizenz: Apache 2.0 für den Quellcode; die Modellgewichte unterliegen Googles eigenen Gemma-Nutzungsbedingungen und werden separat von Hugging Face heruntergeladen
  • Größe: über 6.750 GitHub-Stars, 430+ Forks und 26 offene Issues zum Zeitpunkt dieses Tests
  • Abgrenzung: Es existieren mehrere nahezu identisch benannte Repositories mit ähnlicher Beschreibung unter anderen GitHub-Accounts; drumih/turbo-fieldfare ist das Original mit den meisten Stars und das hier besprochene Repository

Projektgeschichte und Versions-Meilensteine von TurboFieldfare

Das GitHub-Repository von TurboFieldfare wurde im Juli 2026 erstellt – ein vergleichsweise junges Projekt – und hat seither mehrere Releases veröffentlicht, zuletzt mit einer lokalen Gesprächsverlauf-Funktion in der Mac-App.

  1. 1
    Repository erstellt — 17. Juli 2026
    Why it matters: Das kanonische GitHub-Repository von TurboFieldfare (drumih/turbo-fieldfare) wurde laut den Metadaten von GitHub angelegt.
  2. 2
    v0.7.2 — vorheriges Release
    Why it matters: Das Release unmittelbar vor v0.8.0, referenziert im Changelog-Vergleichslink dieses Releases.
  3. 3
    v0.8.0 — 8. September 2026: Lokaler Gesprächsverlauf
    Why it matters: Laut offiziellen Release Notes speichert die Mac-App seither Gesprächsverläufe lokal, sodass Nutzer frühere Chats – inklusive gespeicherter Texte und Bilder – über die Seitenleiste durchsuchen, umbenennen, löschen und erneut öffnen können. Dieses Release ist ausdrücklich als "nur Quellcode" markiert, ohne beigefügte fertige Binärdateien.

Was macht TurboFieldfare eigentlich?

Der Funktionsumfang von TurboFieldfare konzentriert sich darauf, genau ein großes Modell auf bescheidener Apple-Silicon-Hardware nutzbar zu machen. Hier ist, was jeder Teil laut eigenem GitHub-README und Dokumentation tatsächlich leistet.

  • Streaming von Experten-Gewichten von der SSD — statt das komplette ~14,3 GB große Gemma-4-26B-A4B-Modell in den Speicher zu laden, hält TurboFieldfare einen 1,35 GB großen gemeinsamen Kern sowie einen FP16-Key-Value-Cache im Speicher und streamt nur die für jedes Token benötigten Mixture-of-Experts-Gewichte per pread-Aufrufen von der Festplatte, mit einer LFU-Verdrängungsstrategie (least-frequently-used) für den SSD-gestützten Experten-Cache
  • Eigene Metal-Kernels — handgeschriebene Metal-Kernels übernehmen quantisiertes GEMV, Attention, Mixture-of-Experts-Routing, Normalisierung und Sampling, statt auf ein allgemeines ML-Framework zu setzen
  • Chunked Prefill — laut Systemdesign-Dokumentation des Projekts reduziert eine chunked-Prefill-Strategie die Zeit bis zum ersten Token, während der Speicherverbrauch begrenzt bleibt
  • Drei Oberflächen, ein Modell-Speicher — eine native Mac-App, eine Kommandozeilen-Oberfläche (TurboFieldfareCLI) und ein experimenteller Loopback-OpenAI-kompatibler Server (TurboFieldfareServer) greifen alle auf dasselbe .gturbo-Modellverzeichnis zu, wobei jeweils nur ein modellbesitzender Prozess gleichzeitig laufen sollte
  • Optionaler Vision-Turm — Bildeingabe wird über ein separat installierbares Vision-Tower-Zusatzpaket (ca. 1,1 GB) unterstützt, das einen M2 oder neueren Mac voraussetzt; reine Textinferenz bleibt auf M1 verfügbar
  • Keine Tool-Ausführung in App/CLI — die Mac-App und CLI unterstützen Nutzer-/Modellnachrichten sowie optionale Systemanweisungen, exponieren oder führen aber keine Tools aus; der Loopback-Server akzeptiert Function-Tool-Deklarationen und liefert vom Modell erzeugte Tool-Aufrufe zur Ausführung durch den Client zurück, laut README
  • Nicht audio-/videofähig — laut eigener Dokumentation unterstützt TurboFieldfare keine Audio- oder Videoeingabe

Anwendungsbeispiele: Drei Wege, TurboFieldfare zu nutzen

Dies sind konkrete Workflows aus dem eigenen dokumentierten README von TurboFieldfare – keine hypothetischen Anwendungsfälle.

TurboFieldfare-Preise: Ist TurboFieldfare wirklich kostenlos?

Ja – TurboFieldfare hat keine kostenpflichtige Stufe. Der Quellcode ist Apache-2.0-lizenziert und kostenlos zu bauen und auszuführen; es gibt kein Abo, kein Konto und keine Nutzungsgrenze seitens des Projekts.

  • Kein Abo, keine kostenpflichtige Stufe, keine vom Projekt selbst auferlegten Nutzungsgrenzen
  • Kein Konto und keine Anmeldung nötig, um App, CLI oder Server zu bauen oder auszuführen
  • Die Gewichte von Gemma 4 26B-A4B werden einmalig von Hugging Face heruntergeladen und unterliegen Googles eigenen Gemma-Modellbedingungen, getrennt von der Apache-2.0-Quellcodelizenz von TurboFieldfare
  • Die einzigen laufenden Kosten sind Ihre eigene Hardware und Ihr Speicherplatz: ca. 14,3 GB für das Textmodell, plus ca. 1,1 GB mehr, falls Sie den optionalen Bild-Vision-Turm installieren

TurboFieldfare vs. Ollama

TurboFieldfare und Ollama lösen unterschiedliche Probleme: Ollama ist ein universeller lokaler Modell-Runner, der einen großen, wachsenden Katalog offener Modelle unter macOS, Windows und Linux unterstützt, während TurboFieldfare eine Single-Modell-Laufzeitumgebung nur für Apple Silicon ist, optimiert darauf, Gemma 4 26B-A4B in rund 2 GB RAM unterzubringen.

Modellunterstützung

TurboFieldfare vs. Ollama:
TurboFieldfare führt nur Gemma 4 26B-A4B aus; Ollama unterstützt einen breiten, regelmäßig aktualisierten Katalog offener Modelle.

Plattform

TurboFieldfare vs. Ollama:
TurboFieldfare läuft nur unter Apple Silicon/macOS (arm64, macOS 26+); Ollama unterstützt macOS, Windows und Linux.

Installationsmethode

TurboFieldfare vs. Ollama:
TurboFieldfare wird über den Swift Package Manager aus dem Quellcode gebaut; Ollama liefert pro Plattform einen fertigen Installer bzw. ein fertiges Binary.

Speicheransatz

TurboFieldfare vs. Ollama:
TurboFieldfare streamt den Großteil der Experten-Gewichte von der SSD, um auf einen 8-GB-Mac zu passen; Ollama lädt Modelle entsprechend dem verfügbaren RAM/VRAM Ihrer Hardware und benötigt für ein vergleichbar großes Modell in der Regel mehr Speicher.

Engine-Basis

TurboFieldfare vs. Ollama:
TurboFieldfare ist eine eigene Swift/Metal-Laufzeitumgebung, nicht auf llama.cpp aufgebaut; Ollama basiert auf llama.cpp (GGML) als Inferenz-Kern.

Wenn Ihre Priorität darin besteht, genau ein großes Modell auf speicherbegrenzter Apple-Silicon-Hardware auszuführen, ist der enge Fokus von TurboFieldfare genau der Punkt. Wenn Ihre Priorität Flexibilität über viele Modelle und Plattformen hinweg ist, ist Ollama das breitere universelle Tool – siehe den Ollama-Test für Details. Prüfen Sie aktuelle Funktionsdetails direkt auf der jeweiligen Projektseite, bevor Sie sich entscheiden.

Für wen eignet sich TurboFieldfare?

Ob TurboFieldfare passt, hängt davon ab, ob Sie speziell Gemma 4 26B-A4B auf einem speicherbegrenzten Apple-Silicon-Mac ausführen möchten, statt einen universellen lokalen Modell-Runner zu benötigen.

Konkurrenten und Alternativen

TurboFieldfare wird im Bereich lokaler Inferenz-Engines am häufigsten mit Ollama und LMDeploy verglichen – sein Hauptunterscheidungsmerkmal ist, eine eng gefasste, modellspezifische Laufzeitumgebung zu sein statt einer universellen Engine mit Unterstützung für viele Modelle.

Tool
Am bekanntesten für
Link
OllamaUniverseller lokaler Modell-Runner mit großem Modellkatalog, macOS/Windows/LinuxOllama-Test
LMDeployToolkit zum Komprimieren, Bereitstellen und Servieren von LLMs, mit Fokus auf Inferenz-DurchsatzLMDeploy-Test

Diese Liste spiegelt Tools wider, die häufig mit TurboFieldfare verglichen werden, und ist kein unabhängiges Ranking von PromptQuorum – siehe das Local LLM Software Directory für den vollständigen, regelmäßig aktualisierten Katalog, einschließlich des eigenen Directory-Eintrags von TurboFieldfare. Prüfen Sie die aktuelle Plattform- und Modellunterstützung jedes Tools, bevor Sie sich entscheiden.

Häufige Fehler bei der Bewertung von TurboFieldfare

Die meisten Missverständnisse zu TurboFieldfare entstehen, weil Nutzer universelle Engine-Funktionen erwarten, die es bewusst nicht hat, oder ein anderes Repository unter demselben Namen annehmen.

Häufig gestellte Fragen

Was ist TurboFieldfare?

TurboFieldfare (github.com/drumih/turbo-fieldfare) ist eine kostenlose, quelloffene (Apache 2.0) native Swift-und-Metal-Laufzeitumgebung für Apple-Silicon-Macs, die Googles Gemma-4-26B-A4B-Modell mit rund 2 GB RAM ausführt.

Ist TurboFieldfare kostenlos?

Ja, der Quellcode von TurboFieldfare ist kostenlos und Apache-2.0-lizenziert, ohne kostenpflichtige Stufe. Die Gewichte von Gemma 4 26B-A4B werden separat von Hugging Face unter Googles eigenen Gemma-Modellbedingungen heruntergeladen.

Wie installiere ich TurboFieldfare?

Klonen Sie das Repository, führen Sie swift build -c release aus und starten Sie dann .build/release/TurboFieldfareMac. Es gibt keinen fertigen Installer – TurboFieldfare muss über den Swift Package Manager aus dem Quellcode gebaut werden.

Welche Modelle unterstützt TurboFieldfare?

Nur Gemma 4 26B-A4B (instruction-tuned). Es ist eine modellspezifische Laufzeitumgebung, keine universelle Engine mit Unterstützung für beliebige Modelle.

Wie führt TurboFieldfare ein 26B-Modell mit 2 GB RAM aus?

Es hält einen 1,35 GB großen gemeinsamen Kern und einen kleinen KV-Cache im Speicher und streamt die übrigen Mixture-of-Experts-Gewichte des Modells bei Bedarf während der Generierung von der SSD, mithilfe eigener Metal-Kernels und einer LFU-Verdrängungsstrategie für den SSD-gestützten Experten-Cache.

Welche Hardware benötigt TurboFieldfare?

Einen Apple-Silicon-Mac (M1 oder neuer für reinen Text; M2 oder neuer für den optionalen Vision-Turm), macOS 26 mit Metal 4 und rund 14,3 GB freien Speicher für das Textmodell. Zum Bauen benötigen Sie Xcode 26 und Swift 6.2 oder neuer.

Unterstützt TurboFieldfare Windows oder Linux?

Nein, das Paket ist rein arm64 und benötigt macOS 26 mit Metal 4 – es unterstützt weder Windows noch Linux noch Intel-basierte Macs.

Unterstützt TurboFieldfare Bilder?

Ja, über ein separat installierbares Vision-Tower-Zusatzpaket (ca. 1,1 GB), das einen M2 oder neueren Mac voraussetzt. Ohne dieses Paket funktioniert reine Textinferenz weiterhin, auch auf M1-Macs.

Unterstützt TurboFieldfare Tool-Calling?

Die native Mac-App und CLI exponieren oder führen keine Tools aus. Der experimentelle Loopback-OpenAI-kompatible Server akzeptiert Function-Tool-Deklarationen und liefert vom Modell erzeugte Tool-Aufrufe zur Ausführung durch Ihren Client-Code zurück.

Wie unterscheidet sich TurboFieldfare von Ollama?

TurboFieldfare führt über eine eigene Swift/Metal-Laufzeitumgebung nur Gemma 4 26B-A4B auf Apple-Silicon-Macs aus; Ollama ist ein universeller, plattformübergreifender Modell-Runner auf Basis von llama.cpp mit einem deutlich breiteren Modellkatalog. Siehe den Vergleich TurboFieldfare vs. Ollama oben.

Hat PromptQuorum die Angaben von TurboFieldfare unabhängig getestet?

Dieser Test basiert auf dem eigenen GitHub-Repository, README und der Dokumentation von TurboFieldfare, statt auf praktischen Benchmarks durch PromptQuorum.

Quellen

← Zurück zu Lokale LLMs Pro