Skip to main content
PromptQuorum
主页/本地LLM进阶/TurboFieldfare评测:用2GB内存运行Gemma 4 26B-A4B
Overview & Reference

TurboFieldfare评测:用2GB内存运行Gemma 4 26B-A4B

·阅读约11分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

TurboFieldfare是一款面向Apple Silicon Mac的免费开源(Apache 2.0)原生Swift与Metal运行时,它只将1.35GB的共享核心和KV缓存常驻内存,其余模型专家权重按需从SSD流式加载,从而用约2GB内存运行Google的Gemma 4 26B-A4B模型。 它提供原生Mac应用、命令行界面,以及一个实验性的本地OpenAI兼容服务器,全部通过Swift Package Manager从源代码构建——没有预编译安装包,而且它专为Gemma 4 26B-A4B模型打造,而不是像llama.cpp或Ollama那样的通用引擎。

TurboFieldfare(github.com/drumih/turbo-fieldfare)是一款免费开源(Apache 2.0)的原生Swift与Metal运行时,专为在Apple Silicon Mac上运行Google的Gemma 4 26B-A4B模型而打造,包括8GB内存的机型,推理时约占用2GB RAM,GitHub星标已超过6,750。本文将介绍TurboFieldfare的功能、它如何实现这一内存占用、如何构建和安装,以及它适合哪些人。

关键要点

  • TurboFieldfare(github.com/drumih/turbo-fieldfare)是一款免费开源的原生Swift/Metal运行时——不是llama.cpp或MLX的封装
  • 采用Apache 2.0许可,已通过GitHub仓库的LICENSE文件确认
  • 仅运行一个模型系列:指令微调版Gemma 4 26B-A4B(总参数260亿,每token约38.8亿激活参数)
  • 通过将1.35GB共享核心加4K token的KV缓存常驻内存,并在生成过程中通过pread调用从SSD流式加载其余mixture-of-experts权重,实现约2GB的内存占用
  • 提供三种使用方式:原生SwiftUI/AppKit Mac应用、命令行界面(TurboFieldfareCLI),以及实验性的回环OpenAI兼容服务器(TurboFieldfareServer)
  • 需要Apple Silicon Mac、搭载Metal 4的macOS 26,以及Swift 6.2或更高版本的Xcode 26才能从源代码构建——该软件包仅支持arm64
  • 截至本评测,GitHub星标超过6,750,fork数超过430

📍 简单一句话

TurboFieldfare是一款面向Apple Silicon Mac的免费开源(Apache 2.0)原生Swift与Metal运行时,GitHub星标超过6,750,通过从SSD流式加载大部分mixture-of-experts权重、而非将完整的14.3GB模型载入内存,用约2GB内存运行Google的Gemma 4 26B-A4B模型。

💬 简单来说

TurboFieldfare是一款免费应用,你在搭载Apple Silicon芯片的Mac上从源代码构建它。即使在只有8GB内存的Mac上,它也能让你本地运行一个大型(260亿参数)AI模型,因为它每次只在内存中保留模型的一个小"核心",其余部分按需从硬盘读取——不需要云端、不需要订阅,也不能运行除Gemma 4 26B-A4B以外的其他模型。

📌: 本评测是本地LLM软件目录中TurboFieldfare条目的深度补充文章——该页面可让你快速比较TurboFieldfare与其他数十款本地AI工具。

TurboFieldfare是什么?

TurboFieldfare是一款面向Apple Silicon Mac的模型专用本地推理运行时,专为在严格内存预算内运行单一模型——Gemma 4 26B-A4B——而打造,而不是像通用引擎那样支持任意模型。GitHub README直言不讳地描述道:"用约2GB内存运行Gemma 4 26B-A4B推理。为任何Apple Silicon Mac(甚至8GB机型)打造的自定义Swift + Metal运行时。"

  • 产品类型:原生Swift/Metal运行时、CLI和Mac应用——据其自身README所述,并非llama.cpp或MLX的封装
  • 范围:模型专用,仅运行Gemma 4 26B-A4B(指令微调版),不是多模型引擎
  • 仓库:github.com/drumih/turbo-fieldfare,创建于2026年7月17日
  • 许可:源代码采用Apache 2.0;模型权重受Google自身Gemma条款约束,需从Hugging Face单独下载
  • 规模:截至本评测,GitHub星标超过6,750,fork数超过430,开放issue26个
  • 辨识提示:其他GitHub账号下存在多个名称和描述几乎相同的仓库;drumih/turbo-fieldfare是原始仓库,星标最多,也是本文所评测的对象

TurboFieldfare的项目历史与版本里程碑

TurboFieldfare的GitHub仓库创建于2026年7月,是一个相对较新的项目,此后已发布多个版本,最近一次为Mac应用增加了本地对话历史功能。

  1. 1
    仓库创建 — 2026年7月17日
    Why it matters: 根据GitHub的仓库元数据,TurboFieldfare的规范GitHub仓库(drumih/turbo-fieldfare)在此时创建。
  2. 2
    v0.7.2 — 上一个版本
    Why it matters: 紧接在v0.8.0之前的版本,在该版本更新日志的对比链接中被引用。
  3. 3
    v0.8.0 — 2026年9月8日:本地对话历史
    Why it matters: 根据官方发行说明,Mac应用开始在本地保存对话历史,用户可以从侧边栏搜索、重命名、删除并重新打开过往对话——包括已保存的文本和图片。该版本被明确标注为"仅源代码",没有附带预编译二进制文件。

TurboFieldfare实际能做什么?

TurboFieldfare的功能集专注于让单一大模型能在配置一般的Apple Silicon硬件上可用。根据其自身GitHub README和文档,以下是各部分的实际作用。

  • 从SSD流式加载专家权重 — TurboFieldfare不会将完整的约14.3GB Gemma 4 26B-A4B模型载入内存,而是将1.35GB的共享核心和一个FP16键值缓存常驻内存,并通过pread调用,仅从磁盘流式加载每个token所需的mixture-of-experts权重,对SSD支持的专家缓存采用LFU(最少使用)淘汰策略
  • 自定义Metal内核 — 手写的Metal内核处理量化GEMV、注意力机制、mixture-of-experts路由、归一化和采样,而不依赖通用ML框架
  • 分块预填充(chunked prefill) — 根据该项目的系统设计文档,分块预填充策略可在控制内存占用的同时缩短首个token生成的时间
  • 三种界面,一个模型存储 — 原生Mac应用、命令行界面(TurboFieldfareCLI)和实验性的回环OpenAI兼容服务器(TurboFieldfareServer)都读取同一个.gturbo模型目录,但同一时间应只运行一个拥有模型的进程
  • 可选的视觉模块 — 图像输入通过一个可单独安装的视觉塔附加包(约1.1GB)支持,需要M2或更新的Mac;纯文本推理在M1上仍然可用
  • 应用/CLI中不执行工具 — Mac应用和CLI支持用户/模型消息以及可选的系统指令,但不暴露或执行工具;据README所述,回环服务器接受function-tool声明,并返回模型生成的工具调用供客户端执行
  • 不支持音频/视频 — 根据其自身文档,TurboFieldfare不支持音频或视频输入

使用示例:使用TurboFieldfare的三种方式

以下是根据TurboFieldfare自身文档化README整理的具体工作流程,而非假设性用例。

TurboFieldfare定价:真的免费吗?

是的——TurboFieldfare没有付费层级。 源代码采用Apache 2.0许可,构建和运行均免费;该项目本身不设订阅、账户或使用限制。

  • 没有订阅、没有付费层级,TurboFieldfare本身不设使用限制
  • 构建或运行应用、CLI或服务器无需账户或注册
  • Gemma 4 26B-A4B模型权重从Hugging Face一次性下载,受Google自身Gemma模型条款约束,与TurboFieldfare的Apache 2.0源代码许可分开
  • 唯一的持续成本是你自己的硬件和磁盘空间:文本模型约占14.3GB,如果安装可选的图像视觉塔,还需额外约1.1GB

TurboFieldfare对比Ollama

TurboFieldfare与Ollama解决的是不同的问题:Ollama是一款通用本地模型运行器,支持在macOS、Windows和Linux上运行庞大且不断增长的开放权重模型目录;而TurboFieldfare是一款仅限Apple Silicon的单模型运行时,专门优化以将Gemma 4 26B-A4B塞进约2GB内存。

模型支持

TurboFieldfare对比Ollama:
TurboFieldfare仅运行Gemma 4 26B-A4B;Ollama支持广泛且定期更新的开放权重模型目录。

平台

TurboFieldfare对比Ollama:
TurboFieldfare仅限Apple Silicon macOS(arm64,macOS 26+);Ollama支持macOS、Windows和Linux。

安装方式

TurboFieldfare对比Ollama:
TurboFieldfare通过Swift Package Manager从源代码构建;Ollama为每个平台提供预编译安装包/二进制文件。

内存方案

TurboFieldfare对比Ollama:
TurboFieldfare将大部分专家权重从SSD流式加载以适配8GB Mac;Ollama根据硬件可用的RAM/VRAM加载模型,同等规模的模型通常需要更多内存。

引擎基础

TurboFieldfare对比Ollama:
TurboFieldfare是自定义的Swift/Metal运行时,不基于llama.cpp构建;Ollama以llama.cpp(GGML)作为推理内核构建。

如果你的首要需求是在内存受限的Apple Silicon硬件上运行一个特定的大模型,TurboFieldfare的狭窄聚焦恰恰是其价值所在。如果你的首要需求是跨众多模型和平台的灵活性,Ollama是更通用的工具——详情参见Ollama评测。在做决定前,请直接在各项目官网核实当前的功能细节。

TurboFieldfare适合谁?

TurboFieldfare是否适合你,取决于你是否特别想在内存受限的Apple Silicon Mac上运行Gemma 4 26B-A4B,而不是需要一款通用的本地模型运行器。

竞品与替代方案

在本地推理引擎领域,TurboFieldfare最常被拿来与Ollama和LMDeploy比较——它的主要差异化在于,它是一款聚焦范围狭窄的模型专用运行时,而非支持众多模型的通用引擎。

工具
最著名之处
链接
Ollama拥有庞大模型目录的通用本地模型运行器,支持macOS/Windows/LinuxOllama评测
LMDeploy专注于推理吞吐量的LLM压缩、部署和服务工具包LMDeploy评测

此列表反映了在本地推理引擎领域中常与TurboFieldfare比较的工具,并非PromptQuorum的独立排名——完整且定期更新的目录(包括TurboFieldfare自身的目录条目)请参见本地LLM软件目录。在做选择前,请核实每款工具当前的平台和模型支持情况。

评估TurboFieldfare时的常见误区

关于TurboFieldfare的大多数误解,都源于期待它具备刻意未提供的通用引擎功能,或误以为是同名的另一个仓库。

常见问题

TurboFieldfare是什么?

TurboFieldfare(github.com/drumih/turbo-fieldfare)是一款面向Apple Silicon Mac的免费开源(Apache 2.0)原生Swift与Metal运行时,能用约2GB内存运行Google的Gemma 4 26B-A4B模型。

TurboFieldfare免费吗?

是的,TurboFieldfare的源代码免费且采用Apache 2.0许可,没有付费层级。Gemma 4 26B-A4B的模型权重需在Google自身的Gemma模型条款下,从Hugging Face单独下载。

如何安装TurboFieldfare?

克隆仓库,运行swift build -c release,然后启动.build/release/TurboFieldfareMac。没有预编译安装包——TurboFieldfare必须通过Swift Package Manager从源代码构建。

TurboFieldfare支持哪些模型?

仅支持Gemma 4 26B-A4B(指令微调版)。它是一款模型专用运行时,不是支持任意模型的通用引擎。

TurboFieldfare如何用2GB内存运行一个260亿参数的模型?

它将1.35GB的共享核心和一个小型KV缓存常驻内存,并在生成过程中按需从SSD流式加载模型其余的mixture-of-experts权重,借助自定义Metal内核以及针对SSD支持的专家缓存的LFU淘汰策略。

TurboFieldfare需要什么硬件?

一台Apple Silicon Mac(纯文本需M1或更新;可选视觉塔需M2或更新)、搭载Metal 4的macOS 26,以及约14.3GB空闲空间用于文本模型。构建则需要Xcode 26和Swift 6.2或更高版本。

TurboFieldfare支持Windows或Linux吗?

不支持,该软件包仅支持arm64,需要搭载Metal 4的macOS 26——不支持Windows、Linux或基于Intel的Mac。

TurboFieldfare支持图像吗?

支持,通过一个可单独安装的视觉塔附加包(约1.1GB)实现,需要M2或更新的Mac。如果不安装该附加包,纯文本推理仍可正常使用,包括在M1 Mac上。

TurboFieldfare支持工具调用吗?

原生Mac应用和CLI不暴露或执行工具。实验性的回环OpenAI兼容服务器接受function-tool声明,并返回模型生成的工具调用供你的客户端代码执行。

TurboFieldfare与Ollama有何不同?

TurboFieldfare通过自定义Swift/Metal运行时,仅在Apple Silicon Mac上运行Gemma 4 26B-A4B;Ollama是基于llama.cpp构建的通用跨平台模型运行器,支持范围广得多的模型目录。参见上文的TurboFieldfare对比Ollama

PromptQuorum是否独立测试过TurboFieldfare的说法?

本评测基于TurboFieldfare自身的GitHub仓库、README和文档,而非PromptQuorum进行的实际基准测试。

信息来源

← 返回 本地LLM进阶