关键要点
- 本文是 本地 LLM 软件目录 中 Rapid-MLX 词条的配套评测
- 根据仓库的许可证徽章和 LICENSE 文件(2026-09-18 核实),采用 Apache 2.0 免费开源许可
- 仅支持 Apple Silicon(M1–M4)——不存在 Windows 或 Linux 版本
- 根据其官方文档,使用原生 MLX 内核而非 llama.cpp 封装,支持连续批处理和 int4/int8 量化 KV 缓存
- 多模态:文本生成、图像生成(FLUX、SDXL)、视频(Wan、CogVideoX、LTX)、音频(TTS、转录、语音克隆)和嵌入功能
- 截至本评测(2026-09-18),已获得 3,773 个 GitHub 星标和 416 次分叉;主分支提交次数超过 2,500 次
- raullenchai/Rapid-MLX 这个 GitHub 仓库是原始项目——其他用户名下存在几个同名、零星标的分叉,并非独立项目
📍 简单一句话
Rapid-MLX 是一款免费开源(Apache 2.0)、仅支持 macOS 的本地推理服务器,使用原生 MLX 内核运行模型,并提供兼容 OpenAI 和 Anthropic 的端点,供 Claude Code、Cursor、Aider、Cline 等编程智能体使用。
💬 简单来说
Rapid-MLX 不会把你的编程智能体请求转发到云端 API,而是使用 Apple 的 MLX 框架直接在你的 Mac 上运行模型,并采用与 OpenAI 和 Anthropic 相同的请求格式——因此大多数原本对接这两种 API 的工具,只需更换一个 URL 就能接入它。
📌注: 本评测基于 Rapid-MLX 自身的 GitHub README 和仓库元数据撰写。诸如"比 Ollama 快 4.2 倍"这类性能声明属于该项目自行发布的基准测试数据,并非 PromptQuorum 独立测量的结果——在依赖具体数字之前,请先核对仓库自身的基准测试文档。
Rapid-MLX 是什么?
Rapid-MLX 是一款专为 Apple Silicon Mac 打造的本地 AI 推理服务器,使用 Apple 自家的 MLX 数组框架,而不是大多数本地 LLM 工具依赖的 llama.cpp 引擎。 它定位为 OpenAI 和 Anthropic API 的直接替代方案,因此原本针对这两种 API 编写的工具和脚本,可以直接指向本地的 Rapid-MLX 服务器,而不是云端端点。
- 产品类型:命令行推理服务器(另有位于 rapidmlx.com/desktop 的可选桌面应用)——本身不是聊天图形界面
- 仓库地址:github.com/raullenchai/Rapid-MLX,已确认为原始仓库——其他 GitHub 用户名下存在几个同名、零星标的分叉(例如 xinqiyang/rapid-mlx、LXD-8/Rapid-MLX),它们只是普通分叉,不是独立项目,2026-09-18 核实
- 许可证:根据仓库的 LICENSE 文件和许可证徽章(2026-09-18 核实),为 Apache 2.0
- 平台:仅支持 Apple Silicon(M1、M2、M3、M4 系列)上的 macOS——本评测未在仓库中发现 Windows 或 Linux 版本
- 规模:截至本评测(2026-09-18),已获得 3,773 个 GitHub 星标、416 次分叉,主分支提交次数超过 2,500 次
Rapid-MLX 到底能做什么?
Rapid-MLX 使用原生 MLX 内核将模型加载到内存中,并通过形态类似 OpenAI 和 Anthropic API 的本地 HTTP 端点提供服务,此外还提供图像、视频、音频和嵌入端点。
- 接口兼容性:根据仓库 README,文本方面提供
/v1/chat/completions和/v1/messages,其他模态提供/v1/audio/*和/v1/videos - 原生 MLX 执行:使用 MLX 内核运行模型而非回退到 llama.cpp,README 称这使其能够支持连续批处理和 int4/int8 量化 KV 缓存
- 智能体集成:README 记录了经过端到端验证的 5 个"一级"编程智能体支持——Claude Code、Codex CLI、Hermes、Aider 和 DeepSeek Harness——此外还与 Cursor、Cline 等使用 OpenAI/Anthropic 通信格式的工具广泛兼容
- 多模态生成:图像模型(FLUX、SDXL)、视频模型(Wan、CogVideoX、LTX)以及音频(文本转语音、转录、语音克隆、强制对齐——README 列出了 44 个音频相关别名)
- 模型目录:README 列出了 194 个文本模型别名,并给出从 8 GB 内存的设备到 256 GB+ Mac Studio 配置不等的内存分级建议
- 性能声明:Rapid-MLX 自己的 README 称基准测试结果"比 Ollama 快 4.2 倍",缓存后的首个 token 响应时间为 0.08 秒——这些是该项目自行发布的数据,并非本评测独立测得的结果
使用示例:三种使用 Rapid-MLX 的方式
以下是基于 Rapid-MLX 已记录的 API 能力构建的具体工作流,而非假设场景。
安装 Rapid-MLX
Rapid-MLX 可通过 Homebrew、Shell 安装脚本、uv 或 pip 免费安装——其源代码托管在 GitHub 上。
来源 | 链接 |
|---|---|
| GitHub 仓库(源代码,Apache 2.0) | github.com/raullenchai/Rapid-MLX |
| Homebrew | brew install rapid-mlx |
| Shell 安装脚本 | curl -fsSL https://rapidmlx.com/install.sh | bash |
| uv 包管理器 | uv tool install rapid-mlx@latest |
| pip | python3.12 -m pip install rapid-mlx |
| 桌面应用(macOS) | rapidmlx.com/desktop |
根据其 README,Rapid-MLX 需要一台 Apple Silicon Mac 以及 Python 3.10 或更高版本——没有适用于 Windows 或 Linux 的安装路径,旧版 macOS 自带的 Python 可能需要先手动升级。运行安装命令前请前往 GitHub 仓库核实当前的安装说明,因为不同版本之间指令可能会变化。
Rapid-MLX 定价与许可
Rapid-MLX 完全免费,没有付费档位。 根据仓库的 LICENSE 文件和许可证徽章(2026-09-18 核实),它采用 Apache 2.0 许可——这是一种宽松许可证,允许商业使用、修改和再分发。
- Rapid-MLX 本身不设订阅、付费档位或使用限制
- 安装或运行无需注册账号
- 如果你将 Rapid-MLX 作为付费编程智能体或 IDE 插件的后端,该工具自身的定价(如有)仍然适用——Rapid-MLX 本身不额外收费
- 运行更大的模型仍有硬件成本:更大的模型需要更多统一内存,README 中记录的实验性 DeepSeek V4 REAP 模式需要 224 GB 以上统一内存
Rapid-MLX 对比 Ollama
Rapid-MLX 和 Ollama 都是免费的本地推理服务器,但两者定位范围不同:Rapid-MLX 仅支持 Apple Silicon 并使用原生 MLX 内核,而 Ollama 基于 llama.cpp 后端,可跨平台运行。
平台支持
- Rapid-MLX:
- 仅 Apple Silicon 上的 macOS
- Ollama:
- macOS、Windows 和 Linux
推理引擎
- Rapid-MLX:
- 原生 MLX 内核
- Ollama:
- 基于 llama.cpp(GGUF 模型)
API 兼容性
- Rapid-MLX:
- OpenAI + Anthropic 通信格式
- Ollama:
- 自有 API,另有兼容 OpenAI 的模式
支持的模态
- Rapid-MLX:
- 文本、图像、视频、音频、嵌入
- Ollama:
- 文本和具备视觉能力的聊天模型
性能声明
- Rapid-MLX:
- README 称比 Ollama 快 4.2 倍(厂商自报)
- Ollama:
- 本评测未发现对应的官方声明
"快 4.2 倍"这一数字是 Rapid-MLX 自行发布的基准测试结果,本评测并未独立复现——如果原始吞吐量在你特定硬件和模型上的表现对你的决策很重要,请在选择前自行对两款工具做基准测试。如果你无论如何都需要 Windows 或 Linux 支持,两者中只有 Ollama 提供。
谁适合使用 Rapid-MLX?
Rapid-MLX 适合希望为编程智能体或多模态工作流配备原生、兼容 API 的本地推理服务器的 Apple Silicon Mac 用户,而不是需要跨平台工具的用户。
Rapid-MLX 不适合哪些场景
Rapid-MLX 不适合非 Apple Silicon 设备,它本身也不是一款图形化聊天应用。
- 不适合 Windows 或 Linux 用户——两个平台都没有对应版本,本评测也未发现有添加相关版本的路线图承诺
- 不是聊天图形界面——它是一个服务器;你需要连接兼容的客户端/智能体,或使用 rapidmlx.com/desktop 上单独提供的桌面应用
- 不保证在每台设备上都能达到其自行发布的"比 Ollama 快 4.2 倍"这一数字——README 自身的基准测试显示,M2 Pro 32 GB 和 M3 Ultra 256 GB 之间的吞吐量差异为 3–5 倍,结果会随硬件变化
- 不适合同时运行多个图像或视频生成任务——README 记录这些模态采用单任务串行生成方式,以避免内存耗尽
- 本评测未能核实该项目有融资轮次或公司背景——应将其视为独立维护、由社区支持的项目
评估 Rapid-MLX 时的常见错误
关于 Rapid-MLX 的大多数误解,来自把它与同名分叉混淆,或者误以为它能在 Apple Silicon 以外的设备上运行。
竞品与替代方案
Rapid-MLX 最常被拿来与其他专注 Apple Silicon 的推理工具以及跨平台服务器比较,例如 oMLX、Ollama 和 LM Studio——它的主要差异化在于原生 MLX 执行,以及专为编程智能体后端打造的兼容 OpenAI/Anthropic 端点。
工具 | 主要特点 | 链接 |
|---|---|---|
| oMLX | 另一款面向 Apple Silicon 的基于 MLX 的本地推理工具 | oMLX 评测 |
| Ollama | 跨平台、基于 llama.cpp 的本地模型服务器,拥有庞大的模型库 | Ollama 评测 |
| LM Studio | 用于运行本地模型的桌面图形界面,在 Apple Silicon 上可选 MLX 引擎 | LM Studio 评测 |
此列表反映的是常与 Rapid-MLX 比较的工具,并非 PromptQuorum 独立排名——选择前请核实各工具当前的平台支持和功能集。
常见问题
Rapid-MLX 是什么?
Rapid-MLX(github.com/raullenchai/Rapid-MLX)是一款免费开源(Apache 2.0)的本地推理服务器,面向 Apple Silicon Mac,使用原生 MLX 内核运行模型,并提供兼容 OpenAI 和 Anthropic 的 API 端点。
Rapid-MLX 免费吗?
是的。Rapid-MLX 在 Apache 2.0 许可下免费开源,该项目本身不设付费档位、订阅或使用限制。
Rapid-MLX 支持 Windows 或 Linux 吗?
不支持。Rapid-MLX 仅支持 Apple Silicon Mac(M1 至 M4)。本评测在仓库中未发现 Windows 或 Linux 版本。
如何安装 Rapid-MLX?
根据仓库 README,可通过 Homebrew(brew install rapid-mlx)、Shell 安装脚本(curl -fsSL https://rapidmlx.com/install.sh | bash)、uv(uv tool install rapid-mlx@latest)或 pip(python3.12 -m pip install rapid-mlx)安装。桌面应用也可在 rapidmlx.com/desktop 获取。
哪些编程智能体可以配合 Rapid-MLX 使用?
README 记录了经端到端验证的 Claude Code、Codex CLI、Hermes、Aider 和 DeepSeek Harness 支持,此外还与 Cursor、Cline 等任何使用 OpenAI 或 Anthropic API 格式的工具广泛兼容。
Rapid-MLX 真的比 Ollama 快 4.2 倍吗?
这个数字来自 Rapid-MLX 自行发布的 README 基准测试,并非 PromptQuorum 独立测量的结果。如果确切吞吐量对你的决策很重要,请在自己的硬件和模型上分别测试两款工具。
Rapid-MLX 能生成图像、视频或音频吗?
可以。除文本外,其 README 记录了图像生成(FLUX、SDXL)、视频生成(Wan、CogVideoX、LTX)以及音频(文本转语音、转录、语音克隆)端点。
Rapid-MLX 需要多少内存?
这完全取决于你加载的模型。README 列出了 194 个文本模型别名,并给出从 8 GB 设备到 256 GB+ Mac Studio 配置不等的内存分级建议——下载具体模型前请查看其所列的内存需求。
Rapid-MLX 使用什么许可证?
根据仓库的 LICENSE 文件和许可证徽章(2026-09-18 核实),为 Apache 2.0。这是一种宽松许可证,允许商业使用、修改和再分发。
raullenchai/Rapid-MLX 是真正的官方仓库吗?
是的。其他 GitHub 用户名下存在几个同名、零星标的分叉,但 raullenchai/Rapid-MLX 是原始且星标最多、创建时间最早的仓库,2026-09-18 核实。