关键要点
- mlx-serve 免费且开源;GitHub 官方 LICENSE 是 MIT 许可证,部分内置第三方组件采用 Apache License 2.0
- 通过 MLX 在 Apple Silicon 上为支持的模型家族原生运行,并通过内置的 llama.cpp 运行 GGUF 模型
- 在同一端口上同时提供 OpenAI 兼容的 chat/completions 与 Responses API、Anthropic Messages API 以及 Ollama API
- 附带 macOS 菜单栏配套应用 MLX Core,支持多会话聊天、带 MCP 工具支持的智能体模式,以及图像/视频/音乐/语音/3D 生成面板
- 单一约 7 MB 的二进制文件,不依赖 Python 运行时
- 为包括 Claude Code、OpenCode 和 Cursor 在内的编程智能体提供预配置启动器
- 需要 Apple Silicon(M 系列)硬件上的 macOS 26.2 或更高版本 —— 不支持 Windows、Linux 或 Intel Mac
- 由 David Dalcu 开发;截至本评测,项目几乎每天都有打标签的发布
📍 简单一句话
mlx-serve 是面向 Apple Silicon Mac 的免费开源 Zig 推理服务器,从一个二进制文件中提供 OpenAI、Anthropic 和 Ollama 兼容 API,没有付费层级。
💬 简单来说
与其安装 Python 和多个独立软件包来运行本地模型服务器,mlx-serve 是一个用 Homebrew 安装的小程序。它直接通过苹果的 MLX 框架运行模型,对于 GGUF 模型则通过内置的 llama.cpp 副本运行,并以 OpenAI、Anthropic 和 Ollama 使用的相同格式响应请求,因此已经为这些 API 构建的工具无需修改即可使用。
📌注: 本评测是本地 LLM 软件目录中 mlx-serve 条目的深度解读——如需快速了解 mlx-serve 与其他数十款本地 AI 工具的对比,请查看该页面。
mlx-serve 是什么?
mlx-serve 是一款面向 Apple Silicon Mac 的原生推理服务器,可在设备端运行 AI 模型,并通过 OpenAI、Anthropic 和 Ollama 兼容的 API 暴露出来。其自身的 GitHub 描述写道:"Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling."服务器本身用系统编程语言 Zig 编写,这也是它以单一小型二进制文件形式发布,而非需要安装依赖项的 Python 应用的原因。
- 核心功能:一款加载一次模型、同时以三种不同 API 格式通过 HTTP 提供服务的本地推理服务器
- 原生模型调度:对支持的模型家族使用 MLX(苹果自研的面向 Apple Silicon 的数组计算框架),对 GGUF 格式模型使用内置的 llama.cpp
- API 兼容性:OpenAI 的 chat/completions 和 Responses 端点、Anthropic Messages API 以及 Ollama API,默认全部使用 11234 端口
- 配套应用:MLX Core,一款附带的 macOS 菜单栏应用,用于聊天、智能体工作流和媒体生成,作为独立的 Homebrew cask 与服务器一同安装
- 开发者:根据 GitHub 仓库 LICENSE 文件中的版权声明,为个人开发者 David Dalcu
- 权威仓库:github.com/ddalcu/mlx-serve——原始项目;存在多个分支,以及至少一个无关、由不同作者维护的同名项目,请确认您指向的正是这个特定仓库
mlx-serve 发布历史
mlx-serve 的 GitHub 仓库创建于 2026 年 2 月,此后项目持续几乎每天发布打标签的版本,加入了推测解码、编程智能体启动器和扩展的媒体生成能力。这是一个年轻、快速迭代的项目,而非拥有长期业绩记录的成熟项目——评估时应将此纳入考量。
- 1v26.8.9 —— 2026年8月18日:编程智能体启动器
Why it matters: 根据发布说明("launch your coding agent"),新增了编程智能体的预配置启动器,同时提升了聊天体验并加快了解码速度,详见[官方发布页面](https://github.com/ddalcu/mlx-serve/releases)。 - 2v26.8.10 —— 2026年8月26日:Neural Engine 预填充卸载
Why it matters: 新增 Neural Engine 预填充卸载和批量解码,这是一项将部分推理流程转移到苹果专用 Neural Engine 硬件上的优化。 - 3v26.8.11 —— 2026年8月29日:MLX 0.32.2 与 Qwen 3.8 Flash Next
Why it matters: 更新了内置的 MLX 框架版本,并新增对更新版 Qwen 模型变体的支持。 - 4v26.9.1 —— 2026年9月3日:100万上下文与更快的 Flash 解码
Why it matters: 在 MLX Core 配套应用的侧边栏中新增终端,并为兼容模型提供 100 万 token 的上下文窗口支持。 - 5v26.9.2 —— 2026年9月9日:按模型设置与聊天提供商
Why it matters: 新增按模型的配置和额外的聊天提供商选项,并进一步提升解码速度。 - 6v26.9.3 —— 2026年9月16日:全模型支持推测解码
Why it matters: 根据发布说明,将推测解码支持从少数模型扩展到更广范围,同时对 64 GB Mac 上的 Flash 性能进行了优化。 - 7v26.9.4 —— 2026年9月17日:正确性修复与基准测试
Why it matters: 发布了正确性修复,新增中文文档,并公布了新的基准测试数据——截至本评测,这是[官方发布页面](https://github.com/ddalcu/mlx-serve/releases)上记录的最新稳定版标签。
用 mlx-serve 能做什么?
mlx-serve 的功能集专注于在 Apple Silicon 上快速提供模型服务,同时保持与已为其他 API 构建的工具的兼容性。根据项目的 GitHub README,以下是每个部分的实际作用。
- 多 API 服务 —— 服务器在同一端口上同时响应 OpenAI 的 chat/completions 和 Responses 请求、Anthropic Messages API 请求以及 Ollama API 请求,因此现有的 OpenAI/Anthropic/Ollama 客户端代码只需更改基础 URL 即可指向 mlx-serve
- 原生 MLX 模型调度 —— 具有原生 MLX 支持的模型(根据 README:Gemma、Qwen、Llama、Mistral 和 DeepSeek V4 Flash)直接通过苹果的 MLX 框架在 Apple Silicon 上运行
- GGUF 内置 llama.cpp —— 数千个 MLX 不原生支持的 GGUF 格式模型可改为通过内置的 llama.cpp 副本运行,无需单独安装
- 性能特性 —— README 记录了四种推测解码变体、连续批处理、KV 缓存量化,以及针对 Apple Silicon 吞吐量优化的自定义 Metal 内核
- MLX Core 配套应用 —— 一款内置的 macOS 菜单栏应用,提供支持 PDF/图像附件的多会话聊天、带内置工具和 Model Context Protocol(MCP)市场集成的智能体模式、用于运行 shell 命令的隔离 Agent Sandbox、支持断点续传下载的模型浏览器,以及图像、视频、音乐、语音(包括使用 Kokoro 语音的声音克隆)和 3D 模型的生成面板
- 编程智能体启动器 —— 根据发布说明,为包括 Claude Code、OpenCode、Pi 和 Cursor 在内的编程智能体提供预配置启动配置
- 无 Python 依赖 —— 服务器二进制文件约 7 MB,无需 Python 运行时,这与许多其他本地推理工具不同
使用示例:三种使用 mlx-serve 的方式
这些是基于上文 mlx-serve 已记录命令构建的具体工作流程——并非假设性的用例。
安装 mlx-serve
mlx-serve 通过 Homebrew 安装,其源代码托管在 GitHub 上。以下链接来自官方 GitHub README——由于安装说明可能随版本发布而变化,请始终直接在该页面核实。
服务器(Homebrew)
- 链接:
- 先执行
brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve,再执行brew install mlx-serve
MLX Core 配套应用(Homebrew cask)
- 链接:
brew install --cask mlx-core
GitHub 仓库(源代码,MIT 许可证)
项目主页
- 链接:
- mlxserve.com
从源代码构建
- 链接:
- 根据 GitHub README,需要 Xcode 26.2+ 并包含 Metal Toolchain 组件
附带的 MLX Core 菜单栏应用只是配套工具,而非主要安装途径——mlx-serve 本质上是一个命令行服务器,MLX Core 是可选的图形前端。mlx-serve 需要 Apple Silicon 上的 macOS 26.2 或更高版本;它不能在 Intel Mac、Windows 或 Linux 上运行,也没有针对这些平台的官方构建。
mlx-serve 定价:真的免费吗?
是的——mlx-serve 没有付费层级。GitHub 仓库没有定价页面,LICENSE 文件适用于整个应用程序。许可证文本是标准的 MIT 许可证,版权归 David Dalcu 所有——宽松许可,没有 copyleft 义务。GitHub 自身的仓库元数据将整体许可证归类为自定义的"Other"条目,而非单纯的 MIT 徽章,因为该仓库还内置了一些采用 Apache License 2.0 的第三方组件,记录在单独的 NOTICE 文件中。
- 没有订阅、没有付费层级,mlx-serve 本身不设置任何使用限制
- 安装或使用服务器及 MLX Core 配套应用无需账户或注册
- mlx-serve 的核心代码采用 MIT 许可——宽松许可,商业和非商业用途均可免费使用,许可证文本中保留署名条款
- 根据仓库的 NOTICE 文件,部分内置第三方组件采用 Apache License 2.0 而非 MIT 许可——如果贵组织的合规审查依赖于确切的许可证组合,请直接阅读 NOTICE 文件
mlx-serve vs. Ollama
mlx-serve 和 Ollama 都在 Mac 上通过 HTTP API 提供本地模型服务,由于两者都能对接相同的客户端工具,经常被拿来比较。最明显的差异体现在平台支持范围和原生引擎选择上。
方面 | mlx-serve | Ollama |
|---|---|---|
| 平台 | 仅 macOS(Apple Silicon) | macOS、Windows、Linux |
| 原生引擎 | MLX(原生)+ 内置 llama.cpp 处理 GGUF | 基于 llama.cpp |
| API 兼容性 | OpenAI + Anthropic + Ollama API,同一端口 | 自有 API,另加 OpenAI 兼容端点 |
| 内置 GUI | MLX Core 菜单栏应用(聊天、智能体、媒体生成) | 内置 GUI 极简,依赖第三方前端 |
| 运行时依赖 | 单一约 7 MB 二进制文件,无需 Python | 单一 Go 二进制文件,无需 Python |
| 媒体生成 | 通过 MLX Core 支持图像/视频/音乐/语音/3D | 仅支持文本与视觉聊天 |
根据项目文档,mlx-serve 的 Ollama API 兼容性意味着为 Ollama 构建的工具通常可以直接指向 mlx-serve。如果跨平台支持很重要——不仅是 macOS,还包括 Windows 或 Linux——Ollama 是支持范围更广的选择;由于两者都会频繁更新,做决定前请在各自项目官网核实最新的功能细节。
谁适合使用 mlx-serve?
mlx-serve 是否适合,取决于您是否拥有 Apple Silicon 硬件,并希望有一个能说多种客户端 API 格式、外加内置媒体生成 GUI 的服务器。
mlx-serve vs. 其他 MLX 推理工具
mlx-serve 是围绕苹果 MLX 框架涌现出的多个专注 Apple Silicon 的推理服务器之一。以下是它在这一领域中与其他选项相比的定位——完整目录请参见本地 LLM 软件目录,最直接的跨平台正面对比请参见上文专门的mlx-serve vs. Ollama 对比。
- MLX LM —— 苹果自研的 Python 库及命令行工具,用于使用 MLX 运行和微调语言模型;相比 mlx-serve 独立的 Zig 二进制文件,它层级更低、基于 Python。关于 mlx-serve 原生调度所依赖的底层库的更深入介绍,请参见 MLX LM 详解。
- omlx —— 另一款专注 Apple Silicon 的本地推理选择;其功能集和 API 兼容性与 mlx-serve 的对比请参见专门的评测。
- rapid-mlx —— 一款以性能为导向的基于 MLX 的推理工具;与 mlx-serve 的吞吐量及功能对比请参见专门的评测。
- LoRAX —— 一款多 LoRA 适配器服务框架;如果您的工作流需要从一个基础模型服务多个微调适配器,而非每台服务器单一模型,这一点就与您相关——这并非 mlx-serve 的设计重点。
- Ollama —— 一款跨平台的本地模型服务器;它在平台支持范围和原生引擎方面与 mlx-serve 的差异,请参见上文专门的对比部分。
评估 mlx-serve 时的常见错误
关于 mlx-serve 的大多数困惑都源于其平台限制、GitHub 上的许可证分类,或误以为它像大多数其他本地推理服务器一样是 Python 工具。
常见问题
mlx-serve 是什么?
mlx-serve(github.com/ddalcu/mlx-serve)是一款用 Zig 编写的免费开源推理服务器,可在 Apple Silicon Mac 上本地运行 AI 模型,从一个二进制文件中提供 OpenAI 兼容、Anthropic 兼容和 Ollama 兼容的 API。
mlx-serve 免费吗?
是的。GitHub 仓库没有定价页面,其 LICENSE 文件是 MIT 许可证,适用于整个核心应用程序,没有付费层级。
mlx-serve 是开源的吗?使用什么许可证?
是的,mlx-serve 是开源的。其核心 LICENSE 文件是标准的 MIT 许可证,版权归 David Dalcu 所有。该仓库还内置了一些采用 Apache License 2.0 的第三方组件,记录在单独的 NOTICE 文件中,这也是为什么 GitHub 的仓库元数据将许可证显示为自定义的"Other"条目,而非单纯的 MIT 徽章。如需做出法律决策,请自行核实这两份文件。
mlx-serve 支持哪些平台?
根据官方 GitHub README,仅支持 Apple Silicon(M 系列)硬件上的 macOS 26.2 或更高版本。不支持 Windows、Linux 或 Intel Mac。
mlx-serve 需要 Python 吗?
不需要。mlx-serve 用 Zig 编写,以约 7 MB 的单一二进制文件形式发布,不依赖 Python 运行时——这与许多其他本地推理工具不同。
mlx-serve 支持哪些模型格式?
具备原生 MLX 支持的模型(README 中列出了 Gemma、Qwen、Llama、Mistral 和 DeepSeek V4 Flash)直接通过苹果的 MLX 框架运行。其他 GGUF 格式模型则通过内置的 llama.cpp 副本运行,无需单独安装。
MLX Core 是什么?
MLX Core 是 mlx-serve 附带的 macOS 菜单栏配套应用,作为独立的 Homebrew cask 安装。它提供多会话聊天、带 MCP 工具集成的智能体模式、模型浏览器,以及图像、视频、音乐、语音和 3D 模型的生成面板。
mlx-serve 能替代 Ollama 供现有工具使用吗?
通常可以——mlx-serve 在同一端口上,除了 OpenAI 和 Anthropic 兼容 API 外,还提供 Ollama 兼容 API,因此为 Ollama API 构建的工具通常只需更改基础 URL 即可指向 mlx-serve。在生产工作流中切换前,请核实您所用的具体客户端是否兼容。
如何安装 mlx-serve?
通过 Homebrew:先执行 brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve,再执行 brew install mlx-serve 安装服务器;执行 brew install --cask mlx-core 安装可选的菜单栏配套应用。安装前请查看官方 GitHub README获取最新说明。
mlx-serve 是什么时候首次发布的?
mlx-serve 的 GitHub 仓库创建于 2026 年 2 月。截至本评测,该项目几乎每天都有打标签的发布——完整历史请参见官方发布页面。