Skip to main content
PromptQuorum
主页/本地LLM进阶/SwiftLM 评测:面向 Apple Silicon 的原生 Swift MLX 推理服务器
Mobile & Edge LLMs

SwiftLM 评测:面向 Apple Silicon 的原生 Swift MLX 推理服务器

·11 分钟阅读·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

SwiftLM 是一款免费、开源(MIT 许可)的推理服务器,原生使用 Swift 编写,通过严格兼容 OpenAI 的 API 在 Apple Silicon Mac 上运行 MLX 格式的 AI 模型,不涉及 Python 运行时、GIL 或额外的内存拷贝。它由 SharpAI 开发(源代码位于 github.com/SharpAI/SwiftLM),编译为单一二进制文件,支持视觉和音频输入模型,并附带 SwiftBuddy——一款在 iPhone 或 iPad 上直接运行 MLX 模型的 iOS/iPadOS 配套应用。它要求 macOS 14.0 或更高版本,且仅限 Apple Silicon(M1 至 M5);没有 Windows、Linux 或 Intel Mac 版本。

SwiftLM(github.com/SharpAI/SwiftLM)是一款免费、开源、原生 Swift 编写的推理服务器,通过严格兼容 OpenAI 的 API,在 Apple Silicon 上运行 MLX 模型,全程不涉及 Python 运行时。它由 SharpAI 开发——这是一家硅谷公司,平时以将机器学习应用于 CCTV 和 NVR 监控系统而闻名——并附带一个名为 SwiftBuddy 的 iOS/iPadOS 配套应用,用于完全在设备端进行聊天。本评测将介绍 SwiftLM 实际能做什么、它与基于 Python 的 MLX 服务器及 Ollama 相比如何、如何安装,以及它适合哪些用户。

关键要点

  • SwiftLM(github.com/SharpAI/SwiftLM)是面向 MLX 模型的免费、开源、原生 Swift 推理服务器——既不是 IDE,也不是 Python 包
  • 经 GitHub 仓库许可证元数据确认,采用 MIT 许可
  • 根据仓库自身的 Requirements 章节,仅支持 macOS 14.0 以上、Apple Silicon(M1 至 M5)——不支持 Windows、Linux 或 Intel Mac
  • SharpAI 开发,这是一家硅谷组织,其 GitHub 简介将其主营业务描述为将机器学习应用于传统 CCTV/NVR 监控摄像头
  • 提供严格兼容 OpenAI 的 API(/v1/chat/completions/v1/models/health),使现有的 OpenAI 客户端代码可以直接指向它
  • 支持视觉语言模型(通过 --vision),以及针对部分 Gemma-4 变体的音频语言输入(通过 --audio
  • 包含用于超大混合专家模型的 SSD 专家流式加载,以及用于长上下文推理的 TurboQuant KV 缓存压缩
  • 附带 SwiftBuddy,一款免费开源的配套 iOS/iPadOS 应用,可从 HuggingFace 下载 MLX 模型并在设备端运行
  • 截至本评测时(2026 年 9 月 18 日),GitHub 星标数为 768,分叉数为 53;仓库创建于 2026 年 3 月 21 日,在本评测发布前的数周内,版本发布节奏大约为每 1–2 天一次

📍 简单一句话

SwiftLM 是一款免费、开源(MIT)的原生 Swift 推理服务器,面向 Apple Silicon,通过严格兼容 OpenAI 的 API 提供 MLX 模型服务,不涉及 Python 运行时,并附带一款名为 SwiftBuddy 的 iOS/iPadOS 配套应用。

💬 简单来说

SwiftLM 是一个在搭载 Apple Silicon 的 Mac 上运行的命令行程序,它加载一个 AI 模型,让其他应用能像与 OpenAI 服务器通信一样与它对话——只不过一切都运行在你自己的机器上,直接编译为原生 Metal 代码,而不经过 Python。配套的 iPhone/iPad 应用 SwiftBuddy 则直接在手机上做类似的事情。

📌: 本评测是 SwiftLM 在本地 LLM 软件目录中条目的深度补充版本——欲了解 SwiftLM 与数十款其他本地 AI 工具的概览对比,请参阅该页面。本评测基于 SwiftLM 自身的 GitHub 仓库、README 和发布历史,而非 PromptQuorum 对 SharpAI 公布的性能数据进行的独立基准测试。

SwiftLM 是什么?

SwiftLM 是一款完全用 Swift 编写的推理服务器,加载 MLX 格式的 AI 模型,并通过严格兼容 OpenAI 的 HTTP API 提供服务——是 mlx-lm 等基于 Python 的服务器的原生替代方案。官方 GitHub 描述将其概括为「面向 Apple Silicon 的原生 MLX Swift LLM 推理服务器」,它被编译为单一的自包含二进制文件,而不需要 Python 环境、虚拟环境管理器或包安装器。

  • 核心功能:一个本地 HTTP 服务器,一次加载一个 MLX 模型,并通过兼容 OpenAI 的聊天补全端点对外提供服务
  • 实现语言:Swift,使用 Metal 内核编译以进行 GPU 计算——没有 Python,也没有会成为并发请求瓶颈的全局解释器锁(GIL)
  • 开发者:SharpAI,一家自 2018 年 2 月起活跃在 GitHub 上的硅谷组织,其自身简介将主要工作描述为将机器学习引入传统 CCTV/NVR 监控摄像头
  • 底层框架:Apple 的 MLX 数组框架,通过自定义分支(SharpAI/mlxSharpAI/mlx-c)添加了 SharpAI 声称官方 ml-explore 仓库中尚不具备的核外、内存映射执行能力
  • 许可证:经仓库许可证元数据确认为 MIT
  • 规模:截至本评测时,GitHub 星标 768 个,分叉 53 个,贡献者 12 位

谁在开发 SwiftLM,进展有多快?

SwiftLM 是一个年轻、快速发展的项目:其 GitHub 仓库创建于 2026 年 3 月 21 日,截至本评测发布之日,在之前的数周内,带标签的版本大约每一到两天发布一次。

  • 仓库创建时间:2026 年 3 月 21 日——截至本评测时约六个月
  • 近期发布节奏:带标签的构建版本 b703 至 b711 于 2026 年 8 月 27 日至 2026 年 9 月 5 日期间发布,该时间段内平均每约 1.4 天发布一个版本
  • 组织:SharpAI,2018 年 2 月创建于 GitHub,根据其 GitHub 主页信息,总部位于硅谷
  • 主营业务:根据 SharpAI 自身的 GitHub 简介,该组织的主要重心是「用机器学习技术赋能传统 CCTV/NVR 及监控摄像头」——SwiftLM 本身并非监控产品,而是 SharpAI 开源出来的通用推理服务器
  • 贡献者:截至本评测时共 12 位,包括在 SSD 专家流式加载和 TurboQuant KV 缓存压缩方面获得署名的工程工作
  • 自定义 MLX 分支:SharpAI 维护着 SharpAI/mlxSharpAI/mlx-c,这是 Apple 官方 MLX 框架的分支,用于支持 README 中所述、上游尚未提供的核外内存映射执行能力

SwiftLM 能做什么?

SwiftLM 的功能集专注于在 Apple Silicon 上尽可能快速、节省内存地提供 MLX 模型服务,其中若干功能专门针对无法轻松容纳于统一内存中的超大模型。以下是根据 SwiftLM 官方 GitHub README 对各部分功能的说明。

  • 兼容 OpenAI 的服务 — 暴露 /v1/chat/completions/v1/models/health 端点,使现有的 OpenAI 客户端 SDK 和工具可以将 SwiftLM 作为即插即用的本地后端
  • 广泛的模型系列支持 — README 中列出对超过 30 个模型系列的原生支持,包括 Gemma 4/3、Qwen 3.5/3/2.5、Llama 3.x、Mistral/Mixtral、Phi 4/3、DeepSeek V3、GLM 4、Falcon H1 及若干较小的研究系模型系列
  • 视觉语言模型(VLM) — 通过 --vision 标志运行,支持对 Qwen2-VL、Qwen2.5-VL 和 PaliGemma 等模型进行实时 base64 图像解析
  • 音频语言模型(ALM) — 针对部分 Gemma-4「Omni」变体,通过 --audio 标志运行,借助 AVFoundation 的 WAV 提取来解码符合 OpenAI 规范的 input_audio 负载
  • TurboQuant KV 缓存压缩 — 一种针对注意力 KV 缓存的自研非线性(Lloyd-Max 码本)3 比特级量化方案,SharpAI 自身的基准测试称其体积比 FP16 小约 3.5 倍,且精度损失接近于零,通过 --turbo-kv 启用
  • SSD 专家流式加载 — 针对混合专家模型,从 NVMe SSD 流式加载非活跃的专家层,而不要求完整模型驻留在内存中,通过 --stream-experts 启用;SharpAI 自身的测试涵盖了在 64 GB Mac 上运行高达 69.6 GB(Qwen3.5-122B-A10B)和 209 GB(Qwen3.5-397B-A22B)的模型
  • 推测解码与多标记预测(MTP) — 通过单独的小型草稿模型(--draft-model)加速内存中推理,或者对于像 Qwen3 系列这样具有原生 MTP 头的模型,完全无需草稿模型即可加速
  • 精细的内存控制--gpu-layers--prefill-size 等标志可让你调整模型中有多少部分驻留在 GPU 上,以及提示词在预填充阶段如何分块

使用示例:三种使用 SwiftLM 的方式

以下是基于上文中 SwiftLM 已记录的标志和端点构建的具体工作流程——并非假设性的用例。

SwiftLM 的定价与许可

SwiftLM 完全免费,没有任何形式的付费套餐。SwiftLM 及其配套应用 SwiftBuddy 均采用 MIT 许可,这一点经 GitHub 仓库许可证元数据确认——这是一种宽松的开源许可,除保留版权声明外没有其他署名要求,也没有著佐权义务。

  • SwiftLM 本身不设订阅、付费套餐或使用限制
  • 运行服务器或 SwiftBuddy 应用无需账户或注册
  • 根据 GitHub 仓库许可证元数据,MIT 许可适用于整个仓库,包括 SwiftBuddy
  • 唯一真正的成本是硬件:SwiftLM 需要运行 macOS 14.0 或更高版本的 Apple Silicon Mac——它不能在 Intel Mac、Windows 或 Linux 上运行

SwiftLM 对比 Ollama

SwiftLM 和 Ollama 都在兼容 OpenAI 的 API 之后本地运行开放权重模型,但二者的优先级不同——Ollama 优化的是广泛的硬件支持和庞大的现有生态系统,而 SwiftLM 则专注于在 Apple Silicon 上追求极致性能和长上下文效率。

方面
SwiftLM
Ollama
引擎原生 Swift,通过 MLX 编译为 Metal围绕 llama.cpp/GGML C++ 核心的 Go 封装
平台仅 macOS 14+、Apple Silicon,另有 iOS 配套应用macOS、Windows、Linux、Docker;支持 Intel 与 Apple Silicon
运行时依赖无——单一原生二进制文件,无需 Python无——同样是单一原生二进制文件,无需 Python
模型格式通过 MLX 使用 HuggingFace safetensors(mlx-community 构建版本)通过其自有模型库和 Modelfile 系统使用 GGUF
长上下文 KV 压缩TurboQuant,体积约为 FP16 的 1/3.5(--turbo-kv截至本评测,没有专门的 KV 压缩标志
超大 MoE 模型SSD 专家流式加载可运行超出内存容量的 100B+ MoE 模型依赖标准操作系统内存映射,没有专门的流式加载模式
成熟度GitHub 星标 768 个,仓库创建于 2026 年 3 月成熟项目,拥有远为庞大的安装基础和生态系统

此对比反映的是各项目自身 GitHub 仓库中公开记录的功能,而非 PromptQuorum 对任一工具实际吞吐量的独立基准测试。如果你需要跨平台支持(Windows 或 Linux)或最庞大的现有集成生态系统,Ollama 是更成熟的选择;如果你只使用 Apple Silicon,并希望榨取原生 Swift 的性能和长上下文的内存节省,那么 SwiftLM 值得直接评估。

谁应该使用 SwiftLM?

SwiftLM 是否适合你,很大程度上取决于你的硬件——它仅限 Apple Silicon——以及你在多大程度上更看重原生 Swift 性能和长上下文内存效率,而非生态系统的成熟度。

竞品与替代方案

SwiftLM 处于一个规模虽小但正在增长的领域——面向 Apple Silicon 的原生、无需 Python 的 MLX 推理服务器——来看看它与同一细分领域的其他工具,以及它所对标的 Python 参考实现相比如何。

Tool
Best known for
Link
oMLX配备原生 macOS 菜单栏应用及分层 RAM+SSD KV 缓存的 MLX 推理服务器oMLX 评测
Rapid-MLX原生 MLX 推理服务器,同时在本地提供图像、视频和音频生成服务Rapid-MLX 评测
vLLM(MLX 后端)高吞吐量推理服务器,为 Apple Silicon 提供 MLX 后端选项vLLM MLX 评测
mlx-lmApple 官方用于在 MLX 上运行 LLM 的 Python 参考库mlx-lm 详解

这并非 Apple Silicon 推理工具的完整列表——完整、定期更新的目录请参阅本地 LLM 软件目录,其中也包含 SwiftLM 自身的目录条目。

评估 SwiftLM 时的常见误区

关于 SwiftLM 的大多数误解,源于将它与无关的同名项目混淆,或假设它能在明确不支持的硬件上运行。

常见问题

SwiftLM 是什么?

SwiftLM(github.com/SharpAI/SwiftLM)是一款免费、开源(MIT)的原生 Swift 推理服务器,通过严格兼容 OpenAI 的 API,在 Apple Silicon Mac 上运行 MLX 格式的 AI 模型,无需 Python 运行时。

SwiftLM 是免费的吗?

是的。SwiftLM 及其配套应用 SwiftBuddy 均免费,且均采用 MIT 许可,这一点经 GitHub 仓库许可证元数据确认。没有定价页面、账户或付费套餐。

SwiftLM 的系统要求是什么?

根据仓库自身的 Requirements 章节:macOS 14.0 或更高版本、Apple Silicon Mac(M1 至 M5)、Xcode 命令行工具以及 Metal Toolchain。没有 Windows、Linux 或 Intel Mac 版本。

如何安装 SwiftLM?

根据官方 README,可以从项目的 GitHub Releases 页面下载预构建的 macOS arm64 二进制文件并直接运行,或者克隆仓库并运行 ./build.sh 从源代码构建。

SwiftBuddy 是什么?

SwiftBuddy 是 SwiftLM 的免费开源配套应用,面向 iPhone 和 iPad,可从 HuggingFace 下载 MLX 模型并通过 MLX Swift 直接在设备端运行。其源代码位于 SwiftLM 仓库内;截至本评测时,它并未通过 App Store 分发,而是需要通过 Xcode 构建和运行。

SwiftLM 支持视觉或音频输入吗?

支持。根据官方 README,使用 --vision 标志启动 SwiftLM 可启用 Qwen2-VL、PaliGemma 等视觉语言模型,--audio 标志则为部分 Gemma-4「Omni」变体启用音频输入。

TurboQuant 是什么?

TurboQuant 是 SwiftLM 自研的 KV 缓存压缩方案,结合了非线性 Lloyd-Max 码本与硬件加速的 Metal 实现。SharpAI 自身的基准测试称,它能将 KV 缓存压缩到约为 FP16 大小的 1/3.5,且精度损失接近于零,通过 --turbo-kv 标志启用。

SSD 专家流式加载是什么?

这是一项功能,可将非活跃的混合专家层直接从 NVMe SSD 流式加载到 GPU,而不要求完整模型驻留在统一内存中,通过 --stream-experts 启用。SharpAI 自身的测试涵盖了在 64 GB 的 Mac 上运行高达 209 GB 的模型。

谁在开发 SwiftLM?

SwiftLM 由 SharpAI 开发,这是一家自 2018 年起活跃在 GitHub 上的硅谷组织,其主要业务是将机器学习应用于 CCTV/NVR 监控系统。SwiftLM 是该组织与其核心业务分开开源发布的通用推理服务器。

SwiftLM 与 Ollama 相比如何?

两者都在兼容 OpenAI 的 API 之后提供本地模型服务,但 Ollama 支持 macOS、Windows 和 Linux,拥有更为庞大的生态系统,而 SwiftLM 仅限 Apple Silicon,并加入了 TurboQuant KV 压缩、面向超大 MoE 模型的 SSD 专家流式加载等 MLX 原生功能。详见上文专门的 SwiftLM 对比 Ollama

PromptQuorum 是否独立测试过 SwiftLM 的性能声明?

本评测基于 SwiftLM 自身的 GitHub 仓库、README 和发布历史,而非 PromptQuorum 对 SharpAI 公布的性能数据进行的独立基准测试。

资料来源

← 返回 本地LLM进阶