Skip to main content
PromptQuorum
主页/本地LLM进阶/mlxcel 评测:Rust 原生 MLX 推理运行时
Overview & Reference

mlxcel 评测:Rust 原生 MLX 推理运行时

·阅读约11分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

mlxcel 是一款免费、开源(Apache 2.0)、Rust 原生的推理 CLI 和服务器,可在 Apple Silicon 和 NVIDIA CUDA 上运行 LLM、视觉语言模型、嵌入、重排序器和音频模型,并在 Linux 上提供实验性的 AMD ROCm 支持。Lablup 开发——该公司也因其 AI 基础设施平台 Backend.AI 而知名——它通过原生 MLX C++ 绑定直接加载 MLX SafeTensors 检查点,请求路径中不涉及 Python 解释器,可通过 Homebrew 或源码构建安装。

mlxcel(github.com/lablup/mlxcel)是一款免费、开源、Rust 原生的推理 CLI 和服务器,支持大语言模型、视觉语言模型、嵌入、重排序和音频处理,由 Backend.AI 背后的公司 Lablup 开发。它通过原生 MLX C++ 绑定直接执行 MLX SafeTensors 检查点,请求路径中不涉及 Python 解释器,也无需单独的检查点转换步骤。本评测介绍它实际能做什么、如何安装,以及适合哪些人使用。

关键要点

  • mlxcel(github.com/lablup/mlxcel)是一款免费、开源的推理 CLI 和服务器,可通过 Homebrew 或源码构建安装
  • Lablup 开发,该公司也是 AI 基础设施平台 Backend.AI 的开发方
  • 采用 Apache 2.0 许可证,已通过 GitHub 仓库的 LICENSE 文件确认
  • 完全原生执行:Rust 加 MLX C++ 绑定,请求路径中没有 Python 解释器,MLX SafeTensors 权重无需检查点转换步骤
  • 提供 OpenAI、Anthropic 和 Vertex AI 兼容路由,以及有文档记录、版本锁定的 llama-server 兼容路由与参数接口
  • 主要目标平台是 Apple Silicon(Metal);Linux 上的 NVIDIA CUDA 为次要目标;Linux 上的 AMD ROCm 为实验性且仅支持源码构建
  • 单一运行时即可处理文本生成、视觉语言输入、嵌入、重排序和音频(转录与语音合成)
  • 截至本评测时,GitHub star 数超过 467

📍 简单一句话

mlxcel 是一款免费、开源(Apache 2.0)、Rust 原生的推理 CLI 和服务器,支持 LLM、视觉语言模型、嵌入、重排序器和音频,由 Lablup 面向 Apple Silicon 和 NVIDIA CUDA 开发,并提供实验性的 AMD ROCm 支持。

💬 简单来说

mlxcel 是一个用 Rust(而非 Python)编写的命令行工具和服务器,直接从已下载的文件中加载 AI 模型,并在 Mac 或配备 CUDA 的 Linux 机器上运行——无需单独搭建 Python 环境,模型加载前也无需转换步骤。它使用与 OpenAI 和 Anthropic API 相同的请求格式,因此现有客户端代码可以直接对接。

📌: 本评测基于 mlxcel 的 GitHub 仓库、README 及其关联文档撰写。文中不将 mlxcel 自行发布的、与 mlx-lm 和 mlx-vlm 的性能对比数据视为独立核实的事实——这些数据来自项目自身的基准测试方法,应视为厂商自报数据,而非 PromptQuorum 实测结果。本评测是 Local LLM Software Directory 中 mlxcel 条目的深度配套文章。

mlxcel 是什么?

mlxcel 是一款原生推理运行时——既是命令行工具,也是服务器——用于在本地运行 AI 模型,请求路径中不涉及 Python 解释器。 其 GitHub README 将其描述为为「Apple Silicon 和 NVIDIA CUDA 系统提供高性能的 LLM、VLM、嵌入、重排序和音频推理」,通过「原生 MLX C++ 绑定」执行。

  • 产品类型:Rust 原生的 CLI(mlxcel)和服务器(mlxcel-server),以编译好的二进制文件形式通过 Homebrew 分发,或从源码构建——不是 Python 包,也不是图形化桌面应用
  • 开发方:Lablup Inc.,该公司也因开源 AI 基础设施与 MLOps 平台 Backend.AI 而知名
  • 仓库:github.com/lablup/mlxcel,原始项目——在其他 GitHub 用户名下存在多个同名分支,均将该仓库列为父项目
  • 许可证:Apache 2.0,已通过仓库的 LICENSE 文件确认
  • 配套产品:Backend.AI Go,在 mlxcel 自身的 README 中被描述为可搭配 mlxcel-server 使用的可选图形化配套界面,用于本地对话和模型管理

项目历史

mlxcel 的 README 通过 CHANGELOG 记录了版本历史,并将当前的 main 分支描述为 v0.7.0 加未发布的工作。 根据其自身的 changelog 和 README,该项目经历了一系列带标签的版本发布,逐步增加了平台支持目标和服务功能。

  1. 1
    早期版本(至 v0.0.28)——Apple Silicon 优先的推理
    Why it matters: 项目 README 提到了一次早期基准测试活动(README 正文中标注日期为 2026 年 5 月),该测试在 mlxcel 0.0.28 上进行,表明项目在早期发布版本中就已具备可用的文本解码和预填充基准测试功能。
  2. 2
    v0.6.0——带精确性策略的推测解码
    Why it matters: 根据 README,该版本引入了一项策略,会在启用更快的推测解码路径前先探测贪婪精确性,而不是始终使用最快的可用内核而不顾输出正确性。
  3. 3
    v0.7.0——当前发布基线
    Why it matters: README 将其描述为截至本评测时最新的带标签发布版本,支持 DeepSeek-V4 架构、扩展的 llama-server 路由兼容性,以及改进了多个模型系列半精度性能的 dtype 修复。
  4. 4
    未发布的 main 分支——实验性 AMD ROCm 支持
    Why it matters: 截至本评测时,通过 `--features rocm` 提供的 AMD GPU 支持已存在于 `main` 分支,但根据 README 的「Current main highlights」部分,尚未纳入任何带标签的发布版本。

mlxcel 能做什么?

mlxcel 的功能集中于原生运行广泛的模型类型,并提供面向生产环境的服务控制。以下是根据项目自身 README 整理的各项功能实际内容。

  • 直接加载检查点 — 直接从 Hugging Face(包括 mlx-community 组织)加载 MLX SafeTensors 检查点,许多标准 SafeTensors 嵌入检查点也无需转换步骤即可加载
  • 多格式 API 兼容性 — 提供 OpenAI(Chat Completions、Completions、Responses、Embeddings、Reranking、Audio)、Anthropic Messages 和 Vertex AI 兼容路由,以及绑定特定上游版本、有文档记录的原生 llama-server 兼容路由与参数接口
  • 广泛的架构覆盖 — 支持密集 Transformer、稀疏混合专家(MoE)模型、混合状态空间模型、视觉语言/OCR 模型、嵌入、重排序器、语音转文本和文本转语音,可通过 mlxcel arch 命令查询
  • 多模型路由 — 路由模式从模型仓库或目录中发现检查点,按需加载,并通过最近最少使用(LRU)淘汰策略限制常驻模型集合
  • 实时 LoRA 适配器 — 根据 README,多个 LoRA 适配器可保持未融合状态以实现按请求切换,也可融合以实现零解码开销
  • 推测解码 — 针对多个模型系列(包括 Gemma、Qwen 和 GLM-4.7-Flash 的 MTP 路径)提供经过测量和精确性校验的推测解码,可通过 /v1/internal/mtp-policy 端点访问
  • 运维控制 — API 密钥与 CORS/TLS 配置、空闲模型休眠/唤醒、GBNF 语法、扩展的采样控制,以及提示词/缓存可观测性
  • 可复现的模型手术 — 通过 --surgery 参数进行 YAML 定义的加载时权重编辑(scaleaddprunereplaceinterpolate),无需手动编辑权重即可实现可复现的检查点修改

使用示例:三种使用 mlxcel 的方式

以下是基于上文所述 mlxcel 文档化功能构建的具体工作流,命令均来自项目自身的 README。

mlxcel 定价:mlxcel 真的免费吗?

是的——mlxcel 没有付费方案。 它作为免费、Apache 2.0 许可的开源项目发布,无需账户、许可证密钥或使用上限。GitHub 仓库没有定价页面。

  • 安装或运行 mlxcel 本身没有费用——Homebrew 配方和源码构建均免费
  • Apache 2.0 许可证允许商业使用、修改和再分发,但须遵守许可证的标准条款(署名并保留许可声明)
  • 唯一的实际成本是运行所需的硬件(Apple Silicon Mac 或配备 CUDA 的 GPU),以及另行下载模型所需的磁盘空间
  • mlxcel 背后的公司 Lablup 也将 Backend.AI 作为商业 AI 基础设施产品出售,但本评测未发现任何证据表明 mlxcel 的某项功能需要购买 Backend.AI 才能使用——可选的配套应用 Backend.AI Go 在 mlxcel 的 README 中被描述为独立的可选 GUI,而非必需项

mlxcel 对比 llama.cpp

mlxcel 和 llama.cpp 都是原生(非 Python)推理运行时,但在语言、主要平台侧重和检查点格式上有所不同。 llama.cpp 是一个 C/C++ 项目,支持最广泛的硬件和量化 GGUF 格式模型;mlxcel 是一个 Rust 项目,专注于 MLX SafeTensors 检查点,以 Apple Silicon 为主要目标平台,并提供有文档记录的 llama-server 路由兼容性,便于直接替换使用。

语言

mlxcel:
Rust
llama.cpp:
C/C++

主要检查点格式

mlxcel:
MLX SafeTensors
llama.cpp:
GGUF

主要平台

mlxcel:
Apple Silicon(Metal),CUDA 为次要
llama.cpp:
最广泛的硬件支持:CPU、CUDA、Metal、Vulkan 等

维护方

mlxcel:
Lablup(Backend.AI 所属公司)
llama.cpp:
社区维护,最初由 Georgi Gerganov 创建

API 兼容性

mlxcel:
OpenAI、Anthropic、Vertex,加上 llama-server 兼容路由
llama.cpp:
其自身的 llama-server 是 mlxcel 力求兼容的参考实现

这是基于各项目自身文档的事实性功能对比,并非 PromptQuorum 对任一工具进行的实测基准。根据 mlxcel 自行记录的 b10621 兼容性清单,它明确以兼容 llama.cpp 的 llama-server 路由接口为目标,而不是将自己定位为无关的替代方案。

谁适合使用 mlxcel?

mlxcel 适合希望在服务路径中不依赖 Python、需要原生且面向生产的推理运行时的开发者。

评估 mlxcel 时的常见误区

关于 mlxcel 的大多数困惑,源于误以为其平台支持或检查点格式比文档记录的更广泛。

竞品与替代方案

mlxcel 与 vllm-mlx、oMLX 和 Rapid-MLX 处于同一细分领域,即 Apple Silicon 与原生运行时推理服务器——这些都是独立项目,以 OpenAI 兼容或类似的 API 接口运行本地模型,主要区别在于语言(Rust 与 Python)、平台广度和功能侧重。

工具
主要特点
链接
vllm-mlx面向 Apple Silicon 的 vLLM 式连续批处理,基于 Pythonvllm-mlx Review
oMLX带 SSD 支持的提示词缓存的 Apple Silicon 推理服务器oMLX Review
Rapid-MLX专注于服务速度的原生 MLX 推理服务器Rapid-MLX Review
LoRAX在一块 GPU 上从一个基础模型提供数千个 LoRA 适配器服务LoRAX Review

此列表反映的是 Apple Silicon 与原生运行时推理引擎领域中常被比较的工具,并非 PromptQuorum 的独立排名——选择前请核实每个工具当前的功能集。

常见问题

mlxcel 是什么?

mlxcel(github.com/lablup/mlxcel)是一款免费、开源(Apache 2.0)的 Rust 原生推理 CLI 和服务器,支持 LLM、视觉语言模型、嵌入、重排序器和音频,由 Lablup 开发。

mlxcel 是谁开发的?

Lablup Inc.,该公司也因 AI 基础设施与 MLOps 平台 Backend.AI 而知名。

mlxcel 是免费的吗?

是的。它可通过 Homebrew 或源码构建免费安装,采用 Apache 2.0 许可证,没有付费方案、账户或使用上限。

如何安装 mlxcel?

在 macOS 或 Linux 上运行 brew tap lablup/tap && brew install mlxcel,或按照项目 README 的说明,使用相应的功能标志(metalcuda,或实验性的 rocm)通过 Cargo 从源码构建。

mlxcel 支持哪些硬件?

Apple Silicon(Metal)是主要目标平台。Linux 上的 NVIDIA CUDA 是受支持的次要目标平台。Linux 上的 AMD ROCm 是实验性的,仅支持源码构建。纯 CPU 的 Linux 构建可以运行,但不是经过验证的发布目标。

mlxcel 需要 Python 吗?

不需要。mlxcel 用 Rust 编写,通过原生 MLX C++ 绑定执行 MLX 检查点,请求路径中不涉及 Python 解释器。

mlxcel 使用什么检查点格式?

MLX SafeTensors 检查点,包括在 Hugging Face 的 mlx-community 组织下发布的检查点——而不是 llama.cpp 使用的 GGUF 格式。

mlxcel 与 llama.cpp 的 API 兼容吗?

是的,部分兼容,且是有意为之的设计:除了自身兼容 OpenAI、Anthropic 和 Vertex 的端点外,mlxcel 还记录了一份固定且版本锁定的 llama-server 路由与参数兼容性清单。

mlxcel 支持音频和视觉模型吗?

是的。除文本生成、嵌入和重排序外,它还支持视觉语言输入、语音转文本转录,以及(通过 Kokoro 系列模型实现的)文本转语音合成。

PromptQuorum 是否独立测试过 mlxcel 的基准测试说法?

没有。本评测基于 mlxcel 自身的 GitHub 仓库和 README,而非 PromptQuorum 的实际基准测试。项目 README 中的性能对比数据均为自行测量。

资料来源

← 返回 本地LLM进阶