Skip to main content
PromptQuorum
主页/本地LLM进阶/Rapid-MLX 评测:面向 Apple Silicon 的原生 MLX 推理服务器
Overview & Reference

Rapid-MLX 评测:面向 Apple Silicon 的原生 MLX 推理服务器

·阅读约10分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

Rapid-MLX 是一款免费开源、仅支持 Apple Silicon 的本地推理服务器,使用原生 MLX 内核运行模型,并提供兼容 OpenAI 和 Anthropic 的 API 端点,因此 Claude Code、Cursor、Aider、Cline 等编程智能体可以将其作为本地后端使用,而无需依赖云端 API。 它仅支持 macOS(M1 至 M4 系列 Apple Silicon),采用 Apache 2.0 许可证,可通过 Homebrew、Shell 安装脚本、uv 或 pip 安装——没有 Windows 或 Linux 版本。

Rapid-MLX(github.com/raullenchai/Rapid-MLX)是一款免费开源的本地推理引擎,专为 Apple Silicon Mac 打造,截至本评测已获得 3,773 个 GitHub 星标。它使用原生 MLX 内核运行模型,而不是封装 llama.cpp,并提供兼容 OpenAI 和 Anthropic 的 API 端点,让 Claude Code、Cursor、Aider、Cline 等工具可以直接将其作为本地后端替代方案接入。本评测介绍它实际能做什么、如何安装,以及适合哪些用户。

关键要点

  • 本文是 本地 LLM 软件目录 中 Rapid-MLX 词条的配套评测
  • 根据仓库的许可证徽章和 LICENSE 文件(2026-09-18 核实),采用 Apache 2.0 免费开源许可
  • 仅支持 Apple Silicon(M1–M4)——不存在 Windows 或 Linux 版本
  • 根据其官方文档,使用原生 MLX 内核而非 llama.cpp 封装,支持连续批处理和 int4/int8 量化 KV 缓存
  • 多模态:文本生成、图像生成(FLUX、SDXL)、视频(Wan、CogVideoX、LTX)、音频(TTS、转录、语音克隆)和嵌入功能
  • 截至本评测(2026-09-18),已获得 3,773 个 GitHub 星标和 416 次分叉;主分支提交次数超过 2,500 次
  • raullenchai/Rapid-MLX 这个 GitHub 仓库是原始项目——其他用户名下存在几个同名、零星标的分叉,并非独立项目

📍 简单一句话

Rapid-MLX 是一款免费开源(Apache 2.0)、仅支持 macOS 的本地推理服务器,使用原生 MLX 内核运行模型,并提供兼容 OpenAI 和 Anthropic 的端点,供 Claude Code、Cursor、Aider、Cline 等编程智能体使用。

💬 简单来说

Rapid-MLX 不会把你的编程智能体请求转发到云端 API,而是使用 Apple 的 MLX 框架直接在你的 Mac 上运行模型,并采用与 OpenAI 和 Anthropic 相同的请求格式——因此大多数原本对接这两种 API 的工具,只需更换一个 URL 就能接入它。

📌: 本评测基于 Rapid-MLX 自身的 GitHub README 和仓库元数据撰写。诸如"比 Ollama 快 4.2 倍"这类性能声明属于该项目自行发布的基准测试数据,并非 PromptQuorum 独立测量的结果——在依赖具体数字之前,请先核对仓库自身的基准测试文档。

Rapid-MLX 是什么?

Rapid-MLX 是一款专为 Apple Silicon Mac 打造的本地 AI 推理服务器,使用 Apple 自家的 MLX 数组框架,而不是大多数本地 LLM 工具依赖的 llama.cpp 引擎。 它定位为 OpenAI 和 Anthropic API 的直接替代方案,因此原本针对这两种 API 编写的工具和脚本,可以直接指向本地的 Rapid-MLX 服务器,而不是云端端点。

  • 产品类型:命令行推理服务器(另有位于 rapidmlx.com/desktop 的可选桌面应用)——本身不是聊天图形界面
  • 仓库地址:github.com/raullenchai/Rapid-MLX,已确认为原始仓库——其他 GitHub 用户名下存在几个同名、零星标的分叉(例如 xinqiyang/rapid-mlx、LXD-8/Rapid-MLX),它们只是普通分叉,不是独立项目,2026-09-18 核实
  • 许可证:根据仓库的 LICENSE 文件和许可证徽章(2026-09-18 核实),为 Apache 2.0
  • 平台:仅支持 Apple Silicon(M1、M2、M3、M4 系列)上的 macOS——本评测未在仓库中发现 Windows 或 Linux 版本
  • 规模:截至本评测(2026-09-18),已获得 3,773 个 GitHub 星标、416 次分叉,主分支提交次数超过 2,500 次

Rapid-MLX 到底能做什么?

Rapid-MLX 使用原生 MLX 内核将模型加载到内存中,并通过形态类似 OpenAI 和 Anthropic API 的本地 HTTP 端点提供服务,此外还提供图像、视频、音频和嵌入端点。

  • 接口兼容性:根据仓库 README,文本方面提供 /v1/chat/completions/v1/messages,其他模态提供 /v1/audio/*/v1/videos
  • 原生 MLX 执行:使用 MLX 内核运行模型而非回退到 llama.cpp,README 称这使其能够支持连续批处理和 int4/int8 量化 KV 缓存
  • 智能体集成:README 记录了经过端到端验证的 5 个"一级"编程智能体支持——Claude Code、Codex CLI、Hermes、Aider 和 DeepSeek Harness——此外还与 Cursor、Cline 等使用 OpenAI/Anthropic 通信格式的工具广泛兼容
  • 多模态生成:图像模型(FLUX、SDXL)、视频模型(Wan、CogVideoX、LTX)以及音频(文本转语音、转录、语音克隆、强制对齐——README 列出了 44 个音频相关别名)
  • 模型目录:README 列出了 194 个文本模型别名,并给出从 8 GB 内存的设备到 256 GB+ Mac Studio 配置不等的内存分级建议
  • 性能声明:Rapid-MLX 自己的 README 称基准测试结果"比 Ollama 快 4.2 倍",缓存后的首个 token 响应时间为 0.08 秒——这些是该项目自行发布的数据,并非本评测独立测得的结果

使用示例:三种使用 Rapid-MLX 的方式

以下是基于 Rapid-MLX 已记录的 API 能力构建的具体工作流,而非假设场景。

Rapid-MLX 定价与许可

Rapid-MLX 完全免费,没有付费档位。 根据仓库的 LICENSE 文件和许可证徽章(2026-09-18 核实),它采用 Apache 2.0 许可——这是一种宽松许可证,允许商业使用、修改和再分发。

  • Rapid-MLX 本身不设订阅、付费档位或使用限制
  • 安装或运行无需注册账号
  • 如果你将 Rapid-MLX 作为付费编程智能体或 IDE 插件的后端,该工具自身的定价(如有)仍然适用——Rapid-MLX 本身不额外收费
  • 运行更大的模型仍有硬件成本:更大的模型需要更多统一内存,README 中记录的实验性 DeepSeek V4 REAP 模式需要 224 GB 以上统一内存

Rapid-MLX 对比 Ollama

Rapid-MLX 和 Ollama 都是免费的本地推理服务器,但两者定位范围不同:Rapid-MLX 仅支持 Apple Silicon 并使用原生 MLX 内核,而 Ollama 基于 llama.cpp 后端,可跨平台运行。

平台支持

Rapid-MLX:
仅 Apple Silicon 上的 macOS
Ollama:
macOS、Windows 和 Linux

推理引擎

Rapid-MLX:
原生 MLX 内核
Ollama:
基于 llama.cpp(GGUF 模型)

API 兼容性

Rapid-MLX:
OpenAI + Anthropic 通信格式
Ollama:
自有 API,另有兼容 OpenAI 的模式

支持的模态

Rapid-MLX:
文本、图像、视频、音频、嵌入
Ollama:
文本和具备视觉能力的聊天模型

性能声明

Rapid-MLX:
README 称比 Ollama 快 4.2 倍(厂商自报)
Ollama:
本评测未发现对应的官方声明

"快 4.2 倍"这一数字是 Rapid-MLX 自行发布的基准测试结果,本评测并未独立复现——如果原始吞吐量在你特定硬件和模型上的表现对你的决策很重要,请在选择前自行对两款工具做基准测试。如果你无论如何都需要 Windows 或 Linux 支持,两者中只有 Ollama 提供。

谁适合使用 Rapid-MLX?

Rapid-MLX 适合希望为编程智能体或多模态工作流配备原生、兼容 API 的本地推理服务器的 Apple Silicon Mac 用户,而不是需要跨平台工具的用户。

Rapid-MLX 不适合哪些场景

Rapid-MLX 不适合非 Apple Silicon 设备,它本身也不是一款图形化聊天应用。

  • 不适合 Windows 或 Linux 用户——两个平台都没有对应版本,本评测也未发现有添加相关版本的路线图承诺
  • 不是聊天图形界面——它是一个服务器;你需要连接兼容的客户端/智能体,或使用 rapidmlx.com/desktop 上单独提供的桌面应用
  • 不保证在每台设备上都能达到其自行发布的"比 Ollama 快 4.2 倍"这一数字——README 自身的基准测试显示,M2 Pro 32 GB 和 M3 Ultra 256 GB 之间的吞吐量差异为 3–5 倍,结果会随硬件变化
  • 不适合同时运行多个图像或视频生成任务——README 记录这些模态采用单任务串行生成方式,以避免内存耗尽
  • 本评测未能核实该项目有融资轮次或公司背景——应将其视为独立维护、由社区支持的项目

评估 Rapid-MLX 时的常见错误

关于 Rapid-MLX 的大多数误解,来自把它与同名分叉混淆,或者误以为它能在 Apple Silicon 以外的设备上运行。

竞品与替代方案

Rapid-MLX 最常被拿来与其他专注 Apple Silicon 的推理工具以及跨平台服务器比较,例如 oMLX、Ollama 和 LM Studio——它的主要差异化在于原生 MLX 执行,以及专为编程智能体后端打造的兼容 OpenAI/Anthropic 端点。

工具
主要特点
链接
oMLX另一款面向 Apple Silicon 的基于 MLX 的本地推理工具oMLX 评测
Ollama跨平台、基于 llama.cpp 的本地模型服务器,拥有庞大的模型库Ollama 评测
LM Studio用于运行本地模型的桌面图形界面,在 Apple Silicon 上可选 MLX 引擎LM Studio 评测

此列表反映的是常与 Rapid-MLX 比较的工具,并非 PromptQuorum 独立排名——选择前请核实各工具当前的平台支持和功能集。

常见问题

Rapid-MLX 是什么?

Rapid-MLX(github.com/raullenchai/Rapid-MLX)是一款免费开源(Apache 2.0)的本地推理服务器,面向 Apple Silicon Mac,使用原生 MLX 内核运行模型,并提供兼容 OpenAI 和 Anthropic 的 API 端点。

Rapid-MLX 免费吗?

是的。Rapid-MLX 在 Apache 2.0 许可下免费开源,该项目本身不设付费档位、订阅或使用限制。

Rapid-MLX 支持 Windows 或 Linux 吗?

不支持。Rapid-MLX 仅支持 Apple Silicon Mac(M1 至 M4)。本评测在仓库中未发现 Windows 或 Linux 版本。

如何安装 Rapid-MLX?

根据仓库 README,可通过 Homebrew(brew install rapid-mlx)、Shell 安装脚本(curl -fsSL https://rapidmlx.com/install.sh | bash)、uv(uv tool install rapid-mlx@latest)或 pip(python3.12 -m pip install rapid-mlx)安装。桌面应用也可在 rapidmlx.com/desktop 获取。

哪些编程智能体可以配合 Rapid-MLX 使用?

README 记录了经端到端验证的 Claude Code、Codex CLI、Hermes、Aider 和 DeepSeek Harness 支持,此外还与 Cursor、Cline 等任何使用 OpenAI 或 Anthropic API 格式的工具广泛兼容。

Rapid-MLX 真的比 Ollama 快 4.2 倍吗?

这个数字来自 Rapid-MLX 自行发布的 README 基准测试,并非 PromptQuorum 独立测量的结果。如果确切吞吐量对你的决策很重要,请在自己的硬件和模型上分别测试两款工具。

Rapid-MLX 能生成图像、视频或音频吗?

可以。除文本外,其 README 记录了图像生成(FLUX、SDXL)、视频生成(Wan、CogVideoX、LTX)以及音频(文本转语音、转录、语音克隆)端点。

Rapid-MLX 需要多少内存?

这完全取决于你加载的模型。README 列出了 194 个文本模型别名,并给出从 8 GB 设备到 256 GB+ Mac Studio 配置不等的内存分级建议——下载具体模型前请查看其所列的内存需求。

Rapid-MLX 使用什么许可证?

根据仓库的 LICENSE 文件和许可证徽章(2026-09-18 核实),为 Apache 2.0。这是一种宽松许可证,允许商业使用、修改和再分发。

raullenchai/Rapid-MLX 是真正的官方仓库吗?

是的。其他 GitHub 用户名下存在几个同名、零星标的分叉,但 raullenchai/Rapid-MLX 是原始且星标最多、创建时间最早的仓库,2026-09-18 核实。

资料来源

← 返回 本地LLM进阶