Skip to main content
PromptQuorum
主页/本地LLM进阶/mlx-serve 评测 2026:面向 Apple Silicon 的原生 Zig 推理服务器
Overview & Reference

mlx-serve 评测 2026:面向 Apple Silicon 的原生 Zig 推理服务器

·阅读约11分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

mlx-serve 是一款免费开源的推理服务器(源代码位于 github.com/ddalcu/mlx-serve),用 Zig 编写,可在 Apple Silicon Mac 上原生运行 AI 模型,从一个二进制文件中同时暴露 OpenAI 兼容、Anthropic 兼容和 Ollama 兼容的 API。它没有付费层级:GitHub 上的 LICENSE 文件是 MIT 许可证,版权归 David Dalcu 所有,仓库 NOTICE 文件中列出的部分内置第三方组件采用 Apache License 2.0。mlx-serve 需要 Apple Silicon 硬件上的 macOS 26.2 或更高版本,为支持的模型家族原生调度到 MLX,为 GGUF 模型调度到内置的 llama.cpp,并附带一个名为 MLX Core 的 macOS 菜单栏应用,支持聊天、智能体工具调用和媒体生成。

mlx-serve(github.com/ddalcu/mlx-serve)是一款用 Zig 编写的免费开源推理服务器,可在 Apple Silicon Mac 上原生运行大语言模型,从一个约 7 MB 的单一二进制文件中暴露 OpenAI、Anthropic 和 Ollama 兼容的 API,无需 Python 运行时。它为原生 Apple Silicon 模型调度到 MLX,并为 GGUF 模型内置了 llama.cpp,同时附带一个名为 MLX Core 的 macOS 菜单栏配套应用,支持聊天、智能体工作流和媒体生成。本评测将介绍 mlx-serve 的实际功能、安装方式、真实特性集,以及它在 MLX 生态系统其他推理服务器中的定位。

关键要点

  • mlx-serve 免费且开源;GitHub 官方 LICENSE 是 MIT 许可证,部分内置第三方组件采用 Apache License 2.0
  • 通过 MLX 在 Apple Silicon 上为支持的模型家族原生运行,并通过内置的 llama.cpp 运行 GGUF 模型
  • 在同一端口上同时提供 OpenAI 兼容的 chat/completions 与 Responses API、Anthropic Messages API 以及 Ollama API
  • 附带 macOS 菜单栏配套应用 MLX Core,支持多会话聊天、带 MCP 工具支持的智能体模式,以及图像/视频/音乐/语音/3D 生成面板
  • 单一约 7 MB 的二进制文件,不依赖 Python 运行时
  • 为包括 Claude Code、OpenCode 和 Cursor 在内的编程智能体提供预配置启动器
  • 需要 Apple Silicon(M 系列)硬件上的 macOS 26.2 或更高版本 —— 不支持 Windows、Linux 或 Intel Mac
  • David Dalcu 开发;截至本评测,项目几乎每天都有打标签的发布

📍 简单一句话

mlx-serve 是面向 Apple Silicon Mac 的免费开源 Zig 推理服务器,从一个二进制文件中提供 OpenAI、Anthropic 和 Ollama 兼容 API,没有付费层级。

💬 简单来说

与其安装 Python 和多个独立软件包来运行本地模型服务器,mlx-serve 是一个用 Homebrew 安装的小程序。它直接通过苹果的 MLX 框架运行模型,对于 GGUF 模型则通过内置的 llama.cpp 副本运行,并以 OpenAI、Anthropic 和 Ollama 使用的相同格式响应请求,因此已经为这些 API 构建的工具无需修改即可使用。

📌: 本评测是本地 LLM 软件目录中 mlx-serve 条目的深度解读——如需快速了解 mlx-serve 与其他数十款本地 AI 工具的对比,请查看该页面。

mlx-serve 是什么?

mlx-serve 是一款面向 Apple Silicon Mac 的原生推理服务器,可在设备端运行 AI 模型,并通过 OpenAI、Anthropic 和 Ollama 兼容的 API 暴露出来。其自身的 GitHub 描述写道:"Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling."服务器本身用系统编程语言 Zig 编写,这也是它以单一小型二进制文件形式发布,而非需要安装依赖项的 Python 应用的原因。

  • 核心功能:一款加载一次模型、同时以三种不同 API 格式通过 HTTP 提供服务的本地推理服务器
  • 原生模型调度:对支持的模型家族使用 MLX(苹果自研的面向 Apple Silicon 的数组计算框架),对 GGUF 格式模型使用内置的 llama.cpp
  • API 兼容性:OpenAI 的 chat/completions 和 Responses 端点、Anthropic Messages API 以及 Ollama API,默认全部使用 11234 端口
  • 配套应用:MLX Core,一款附带的 macOS 菜单栏应用,用于聊天、智能体工作流和媒体生成,作为独立的 Homebrew cask 与服务器一同安装
  • 开发者:根据 GitHub 仓库 LICENSE 文件中的版权声明,为个人开发者 David Dalcu
  • 权威仓库:github.com/ddalcu/mlx-serve——原始项目;存在多个分支,以及至少一个无关、由不同作者维护的同名项目,请确认您指向的正是这个特定仓库

mlx-serve 发布历史

mlx-serve 的 GitHub 仓库创建于 2026 年 2 月,此后项目持续几乎每天发布打标签的版本,加入了推测解码、编程智能体启动器和扩展的媒体生成能力。这是一个年轻、快速迭代的项目,而非拥有长期业绩记录的成熟项目——评估时应将此纳入考量。

  1. 1
    v26.8.9 —— 2026年8月18日:编程智能体启动器
    Why it matters: 根据发布说明("launch your coding agent"),新增了编程智能体的预配置启动器,同时提升了聊天体验并加快了解码速度,详见[官方发布页面](https://github.com/ddalcu/mlx-serve/releases)。
  2. 2
    v26.8.10 —— 2026年8月26日:Neural Engine 预填充卸载
    Why it matters: 新增 Neural Engine 预填充卸载和批量解码,这是一项将部分推理流程转移到苹果专用 Neural Engine 硬件上的优化。
  3. 3
    v26.8.11 —— 2026年8月29日:MLX 0.32.2 与 Qwen 3.8 Flash Next
    Why it matters: 更新了内置的 MLX 框架版本,并新增对更新版 Qwen 模型变体的支持。
  4. 4
    v26.9.1 —— 2026年9月3日:100万上下文与更快的 Flash 解码
    Why it matters: 在 MLX Core 配套应用的侧边栏中新增终端,并为兼容模型提供 100 万 token 的上下文窗口支持。
  5. 5
    v26.9.2 —— 2026年9月9日:按模型设置与聊天提供商
    Why it matters: 新增按模型的配置和额外的聊天提供商选项,并进一步提升解码速度。
  6. 6
    v26.9.3 —— 2026年9月16日:全模型支持推测解码
    Why it matters: 根据发布说明,将推测解码支持从少数模型扩展到更广范围,同时对 64 GB Mac 上的 Flash 性能进行了优化。
  7. 7
    v26.9.4 —— 2026年9月17日:正确性修复与基准测试
    Why it matters: 发布了正确性修复,新增中文文档,并公布了新的基准测试数据——截至本评测,这是[官方发布页面](https://github.com/ddalcu/mlx-serve/releases)上记录的最新稳定版标签。

用 mlx-serve 能做什么?

mlx-serve 的功能集专注于在 Apple Silicon 上快速提供模型服务,同时保持与已为其他 API 构建的工具的兼容性。根据项目的 GitHub README,以下是每个部分的实际作用。

  • 多 API 服务 —— 服务器在同一端口上同时响应 OpenAI 的 chat/completions 和 Responses 请求、Anthropic Messages API 请求以及 Ollama API 请求,因此现有的 OpenAI/Anthropic/Ollama 客户端代码只需更改基础 URL 即可指向 mlx-serve
  • 原生 MLX 模型调度 —— 具有原生 MLX 支持的模型(根据 README:Gemma、Qwen、Llama、Mistral 和 DeepSeek V4 Flash)直接通过苹果的 MLX 框架在 Apple Silicon 上运行
  • GGUF 内置 llama.cpp —— 数千个 MLX 不原生支持的 GGUF 格式模型可改为通过内置的 llama.cpp 副本运行,无需单独安装
  • 性能特性 —— README 记录了四种推测解码变体、连续批处理、KV 缓存量化,以及针对 Apple Silicon 吞吐量优化的自定义 Metal 内核
  • MLX Core 配套应用 —— 一款内置的 macOS 菜单栏应用,提供支持 PDF/图像附件的多会话聊天、带内置工具和 Model Context Protocol(MCP)市场集成的智能体模式、用于运行 shell 命令的隔离 Agent Sandbox、支持断点续传下载的模型浏览器,以及图像、视频、音乐、语音(包括使用 Kokoro 语音的声音克隆)和 3D 模型的生成面板
  • 编程智能体启动器 —— 根据发布说明,为包括 Claude Code、OpenCode、Pi 和 Cursor 在内的编程智能体提供预配置启动配置
  • 无 Python 依赖 —— 服务器二进制文件约 7 MB,无需 Python 运行时,这与许多其他本地推理工具不同

使用示例:三种使用 mlx-serve 的方式

这些是基于上文 mlx-serve 已记录命令构建的具体工作流程——并非假设性的用例。

mlx-serve 定价:真的免费吗?

是的——mlx-serve 没有付费层级。GitHub 仓库没有定价页面,LICENSE 文件适用于整个应用程序。许可证文本是标准的 MIT 许可证,版权归 David Dalcu 所有——宽松许可,没有 copyleft 义务。GitHub 自身的仓库元数据将整体许可证归类为自定义的"Other"条目,而非单纯的 MIT 徽章,因为该仓库还内置了一些采用 Apache License 2.0 的第三方组件,记录在单独的 NOTICE 文件中。

  • 没有订阅、没有付费层级,mlx-serve 本身不设置任何使用限制
  • 安装或使用服务器及 MLX Core 配套应用无需账户或注册
  • mlx-serve 的核心代码采用 MIT 许可——宽松许可,商业和非商业用途均可免费使用,许可证文本中保留署名条款
  • 根据仓库的 NOTICE 文件,部分内置第三方组件采用 Apache License 2.0 而非 MIT 许可——如果贵组织的合规审查依赖于确切的许可证组合,请直接阅读 NOTICE 文件

mlx-serve vs. Ollama

mlx-serve 和 Ollama 都在 Mac 上通过 HTTP API 提供本地模型服务,由于两者都能对接相同的客户端工具,经常被拿来比较。最明显的差异体现在平台支持范围和原生引擎选择上。

方面
mlx-serve
Ollama
平台仅 macOS(Apple Silicon)macOS、Windows、Linux
原生引擎MLX(原生)+ 内置 llama.cpp 处理 GGUF基于 llama.cpp
API 兼容性OpenAI + Anthropic + Ollama API,同一端口自有 API,另加 OpenAI 兼容端点
内置 GUIMLX Core 菜单栏应用(聊天、智能体、媒体生成)内置 GUI 极简,依赖第三方前端
运行时依赖单一约 7 MB 二进制文件,无需 Python单一 Go 二进制文件,无需 Python
媒体生成通过 MLX Core 支持图像/视频/音乐/语音/3D仅支持文本与视觉聊天

根据项目文档,mlx-serve 的 Ollama API 兼容性意味着为 Ollama 构建的工具通常可以直接指向 mlx-serve。如果跨平台支持很重要——不仅是 macOS,还包括 Windows 或 Linux——Ollama 是支持范围更广的选择;由于两者都会频繁更新,做决定前请在各自项目官网核实最新的功能细节。

谁适合使用 mlx-serve?

mlx-serve 是否适合,取决于您是否拥有 Apple Silicon 硬件,并希望有一个能说多种客户端 API 格式、外加内置媒体生成 GUI 的服务器。

mlx-serve vs. 其他 MLX 推理工具

mlx-serve 是围绕苹果 MLX 框架涌现出的多个专注 Apple Silicon 的推理服务器之一。以下是它在这一领域中与其他选项相比的定位——完整目录请参见本地 LLM 软件目录,最直接的跨平台正面对比请参见上文专门的mlx-serve vs. Ollama 对比

  • MLX LM —— 苹果自研的 Python 库及命令行工具,用于使用 MLX 运行和微调语言模型;相比 mlx-serve 独立的 Zig 二进制文件,它层级更低、基于 Python。关于 mlx-serve 原生调度所依赖的底层库的更深入介绍,请参见 MLX LM 详解
  • omlx —— 另一款专注 Apple Silicon 的本地推理选择;其功能集和 API 兼容性与 mlx-serve 的对比请参见专门的评测。
  • rapid-mlx —— 一款以性能为导向的基于 MLX 的推理工具;与 mlx-serve 的吞吐量及功能对比请参见专门的评测。
  • LoRAX —— 一款多 LoRA 适配器服务框架;如果您的工作流需要从一个基础模型服务多个微调适配器,而非每台服务器单一模型,这一点就与您相关——这并非 mlx-serve 的设计重点。
  • Ollama —— 一款跨平台的本地模型服务器;它在平台支持范围和原生引擎方面与 mlx-serve 的差异,请参见上文专门的对比部分。

评估 mlx-serve 时的常见错误

关于 mlx-serve 的大多数困惑都源于其平台限制、GitHub 上的许可证分类,或误以为它像大多数其他本地推理服务器一样是 Python 工具。

常见问题

mlx-serve 是什么?

mlx-serve(github.com/ddalcu/mlx-serve)是一款用 Zig 编写的免费开源推理服务器,可在 Apple Silicon Mac 上本地运行 AI 模型,从一个二进制文件中提供 OpenAI 兼容、Anthropic 兼容和 Ollama 兼容的 API。

mlx-serve 免费吗?

是的。GitHub 仓库没有定价页面,其 LICENSE 文件是 MIT 许可证,适用于整个核心应用程序,没有付费层级。

mlx-serve 是开源的吗?使用什么许可证?

是的,mlx-serve 是开源的。其核心 LICENSE 文件是标准的 MIT 许可证,版权归 David Dalcu 所有。该仓库还内置了一些采用 Apache License 2.0 的第三方组件,记录在单独的 NOTICE 文件中,这也是为什么 GitHub 的仓库元数据将许可证显示为自定义的"Other"条目,而非单纯的 MIT 徽章。如需做出法律决策,请自行核实这两份文件。

mlx-serve 支持哪些平台?

根据官方 GitHub README,仅支持 Apple Silicon(M 系列)硬件上的 macOS 26.2 或更高版本。不支持 Windows、Linux 或 Intel Mac。

mlx-serve 需要 Python 吗?

不需要。mlx-serve 用 Zig 编写,以约 7 MB 的单一二进制文件形式发布,不依赖 Python 运行时——这与许多其他本地推理工具不同。

mlx-serve 支持哪些模型格式?

具备原生 MLX 支持的模型(README 中列出了 Gemma、Qwen、Llama、Mistral 和 DeepSeek V4 Flash)直接通过苹果的 MLX 框架运行。其他 GGUF 格式模型则通过内置的 llama.cpp 副本运行,无需单独安装。

MLX Core 是什么?

MLX Core 是 mlx-serve 附带的 macOS 菜单栏配套应用,作为独立的 Homebrew cask 安装。它提供多会话聊天、带 MCP 工具集成的智能体模式、模型浏览器,以及图像、视频、音乐、语音和 3D 模型的生成面板。

mlx-serve 能替代 Ollama 供现有工具使用吗?

通常可以——mlx-serve 在同一端口上,除了 OpenAI 和 Anthropic 兼容 API 外,还提供 Ollama 兼容 API,因此为 Ollama API 构建的工具通常只需更改基础 URL 即可指向 mlx-serve。在生产工作流中切换前,请核实您所用的具体客户端是否兼容。

如何安装 mlx-serve?

通过 Homebrew:先执行 brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve,再执行 brew install mlx-serve 安装服务器;执行 brew install --cask mlx-core 安装可选的菜单栏配套应用。安装前请查看官方 GitHub README获取最新说明。

mlx-serve 是什么时候首次发布的?

mlx-serve 的 GitHub 仓库创建于 2026 年 2 月。截至本评测,该项目几乎每天都有打标签的发布——完整历史请参见官方发布页面

参考来源

← 返回 本地LLM进阶