Skip to main content
PromptQuorum
主页/本地LLM进阶/oMLX评测2026:带SSD缓存的Apple Silicon推理服务器
Overview & Reference

oMLX评测2026:带SSD缓存的Apple Silicon推理服务器

·阅读约9分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

oMLX是一款面向Apple Silicon的免费开源本地推理服务器(源码在github.com/jundot/omlx),通过Apple的MLX框架在你自己的Mac上运行开放权重模型,配有用于管理的原生macOS菜单栏应用,以及供其他工具使用的兼容OpenAI/Anthropic的API端点。它采用未经修改的标准Apache License 2.0许可(版权归oMLX contributors所有),没有付费层级。oMLX需要Apple Silicon(M1至M5)上运行macOS 15.0(Sequoia)或更高版本——它不支持Intel Mac、Windows或Linux,因为MLX本身只面向Apple Silicon。它的核心功能是分层键值缓存,可将不活跃的上下文块卸载到SSD而不是丢弃,这样当编程代理重新访问一段长对话时,可以在几秒内恢复该上下文,而不必从头重新计算。

oMLX(github.com/jundot/omlx,文档也发布在omlx.ai)是一款免费开源的本地推理服务器,基于Apple的MLX框架构建,同时以原生macOS菜单栏应用和命令行服务器两种形式发布。它可在你的Mac上完全运行开放权重模型,提供兼容OpenAI和Anthropic的API端点,并新增了分层RAM加SSD键值缓存,专为让长编程代理上下文在重启后仍能快速恢复而设计。本评测将介绍oMLX实际能做什么、如何安装、与简单的mlx-lm相比如何,以及它在其他本地推理工具中的定位。

关键要点

  • oMLX免费开源;官方GitHub LICENSE是未经修改的标准Apache License 2.0,版权归oMLX contributors所有
  • 完全通过Apple的MLX框架和mlx-lmBatchGenerator在本地运行——无需联网
  • 需要macOS 15.0(Sequoia)或更高版本Apple Silicon(M1–M5)以及Python 3.11–3.13;不支持Intel Mac、Windows或Linux
  • 提供原生macOS菜单栏应用(Swift/SwiftUI,而非Electron),以及omlx命令行工具和后台服务器
  • 分层键值缓存——热数据块留在RAM,冷数据块以safetensors格式卸载到SSD,支持前缀共享和写时复制,在服务器重启后依然持久保留
  • http://localhost:8000上提供兼容OpenAI(/v1/chat/completions/v1/completions/v1/embeddings/v1/rerank)和兼容Anthropic(/v1/messages)的端点
  • 通过内置管理仪表盘为Claude Code、Cursor、OpenClaw、OpenCode、Codex、Hermes Agent、Copilot和Pi等编程代理集成提供一键配置
  • 由独立开发者jundot开发,于2026年3月在一个MLX GitHub讨论帖中首次公开发布;正式仓库是github.com/jundot/omlx——其他GitHub用户名下存在多个同名分支,均非原始项目

📍 简单一句话

oMLX是一款面向Apple Silicon Mac的免费开源本地推理服务器,通过MLX运行模型,以菜单栏应用加CLI/服务器的形式发布,并新增分页SSD缓存,让编程代理上下文能快速重新加载,而不必从头重新计算。

💬 简单来说

每次重新打开编程代理时,模型不必从零重新加载整个对话历史,oMLX会将该上下文的处理结果保存到Mac的SSD上,并在几秒内恢复。它完全运行在你自己的Mac上,有一个菜单栏图标,让你无需接触终端,同时它也支持与OpenAI和Anthropic相同的API格式,因此Claude Code或Cursor等工具可以直接接入它。

📌: 本评测是本地LLM软件目录中oMLX条目的深度延伸内容——请查看该页面,快速了解oMLX与其他数十款本地AI工具的对比情况。

oMLX是什么?

oMLX是一款面向Apple Silicon Mac的本地推理服务器,将Apple的MLX机器学习框架转变为一套完整的服务栈——包括兼容OpenAI/Anthropic的API、多模型管理器、分页SSD缓存,以及用于统一控制的原生macOS菜单栏应用,日常使用无需终端。其GitHub自述将其定位为"一款针对Apple Silicon Mac优化的LLM推理服务器,具备连续批处理、分层KV缓存以及原生macOS菜单栏管理界面"。

  • 核心功能:一个后台推理服务器,加载开放权重模型并通过本地HTTP API提供服务,可通过菜单栏应用或omlx CLI进行管理
  • 推理引擎:根据oMLX自身文档,构建在Apple的MLX框架和mlx-lm库的BatchGenerator之上,并在此基础上添加了原创的连续批处理与分页缓存层
  • 基础:根据开发者本人的公告,oMLX最初以vllm-mlx为起点构建,并加入了原创实现,包括SSD缓存分层、连续批处理、视觉语言模型支持、兼容Anthropic的API以及原生macOS界面
  • 开发者:jundot(仓库中列出的联系方式为junkim.dot@gmail.com),一位独立维护者——本评测未发现oMLX背后有公司或融资轮次的证据
  • 正式仓库:github.com/jundot/omlx——其他GitHub用户名下存在多个同名分支(例如mkmsyk/omlx、dannysl/omlx),它们并非原始项目

oMLX的起源与成长

oMLX由开发者jundot于2026年3月在Apple MLX自己的GitHub讨论区上首次公开发布。该公告将oMLX定位为解决一个具体问题的方案:在Apple Silicon上,重复使用长上下文的编程代理在每次请求时都可能遇到几十秒级别的重新加载延迟,因为当时基于MLX的服务器通常只将键值缓存状态保存在RAM中,一旦服务器重启或上下文过期就会丢失。oMLX的分页SSD缓存则将该状态持久化到磁盘,这样之前处理过的前缀就可以从SSD恢复,而不必由模型重新计算。根据开发者本人的公告,oMLX在发布时已积累约110颗GitHub星标,以vllm-mlx为起点构建,并新增了SSD分层、连续批处理、视觉语言模型支持、兼容Anthropic的API以及原生macOS界面的代码。截至本评测发布之日,oMLX的GitHub仓库显示约21,859颗星——对于撰写本文时仅诞生六个月的项目来说,这是快速的增长。

  • 公告:2026年3月4日,发布于github.com/ml-explore/mlx/discussions/3203,由项目开发者jundot本人发布
  • 起点:vllm-mlx,在此基础上加入了开发者自己编写的SSD分层、连续批处理、VLM、Anthropic API和原生UI代码
  • 增长:根据oMLX自己的GitHub仓库,从2026年3月公告时的约110颗GitHub星标增长到本评测撰写时的约21,859颗星
  • 许可历史:仓库的LICENSE文件带有"oMLX contributors"2025年的版权声明,早于项目2026年3月的公开公告——这与项目在公开发布前进行私下开发的情况相符

oMLX能做什么?

oMLX的功能集核心在于将MLX模型推理转变为持久化的多模型本地服务器,而不是一次性脚本。以下是根据oMLX自身的GitHub自述omlx.ai文档,每部分实际所做的事情。

  • 分层键值缓存 — 活跃的上下文块保留在热RAM层;不活跃的块以safetensors格式移动到冷SSD层,支持前缀共享和写时复制,缓存在服务器重启后依然保留,而不会被丢弃
  • 连续批处理 — 并发请求通过mlx-lmBatchGenerator处理,可配置最大并发数,而不是逐一处理请求
  • 多模型服务 — 并行加载LLM、视觉语言模型(VLM)、嵌入模型和重排序模型,支持LRU淘汰、手动加载/卸载、模型固定以及可为每个模型配置的存活时间
  • 兼容OpenAI和Anthropic的API — 为OpenAI格式客户端提供/v1/chat/completions/v1/completions/v1/embeddings/v1/rerank,为Anthropic格式客户端提供/v1/messages,全部通过http://localhost:8000提供服务
  • 视觉语言与OCR支持 — 支持base64、URL或文件输入的多图聊天、带视觉上下文的工具调用,以及专用OCR模型的自动检测
  • 工具调用与MCP — 支持JSON模式的工具调用,可自动检测Llama、Qwen、DeepSeek、Gemma、GLM、MiniMax、Mistral等模型系列的聊天模板,并支持Model Context Protocol(MCP)配置
  • 原生macOS菜单栏应用 — 根据项目自身文档,这是一款Swift/SwiftUI应用(明确不是Electron),可在无需终端的情况下启动、停止和监控服务器,并附带本地使用分析(按模型统计、每小时使用热力图)以及崩溃后自动重启
  • 管理仪表盘 — 服务器运行后,可通过浏览器访问/admin处的Web界面,用于模型管理、内置聊天界面、一键基准测试、模型下载器,以及针对Claude Code、Cursor、OpenClaw、OpenCode、Codex、Hermes Agent、Copilot和Pi等编程代理集成的一键配置
  • 实验性分布式推理 — 通过Ring或Thunderbolt RDMA网络,在MLX管道等级之间实现多Mac推理,在oMLX自身文档中被标记为实验性功能

使用示例:oMLX的三种用法

以下是基于上文所述oMLX功能构建的具体工作流程,而非假设性用例。

oMLX定价:oMLX真的免费吗?

是的——oMLX没有付费层级。无论是GitHub仓库还是omlx.ai都没有定价页面,LICENSE文件是未经修改的标准Apache License 2.0,带有"oMLX contributors"2025年的版权声明——它适用于整个应用程序,没有任何条款将某项功能锁定在付费之后。

  • 没有订阅、没有付费层级、oMLX自身也不施加任何使用限制
  • 安装或运行该应用无需账户或注册
  • 应用程序本身、菜单栏应用、CLI和管理仪表盘均受同一套Apache License 2.0条款约束
  • 由于oMLX只通过MLX运行本地模型,因此也不存在向云服务商支付的按token或按请求计费的成本——唯一的成本是你本就拥有的电费和硬件

oMLX vs. mlx-lm

mlx-lm是Apple MLX生态系统为运行和提供模型服务而提供的Python库和简单CLI——oMLX正是直接构建在它之上,利用其BatchGenerator实现连续批处理。两者其实并非真正的竞争关系,而更像是不同的层次:mlx-lm是基础,oMLX是构建在这一基础之上的完整服务产品。

方面
oMLX
mlx-lm
定位打包好的推理服务器:菜单栏应用+CLI+管理仪表盘用于运行/提供MLX模型服务的Python库和轻量CLI
KV缓存分层RAM+SSD分页缓存,重启后依然保留根据其自身文档记录的服务器,仅有内存中缓存;没有SSD分层
多模型管理LRU淘汰、固定、按模型TTL、从界面加载/卸载不是内置功能——需脚本化或手动管理
API兼容性兼容OpenAI和兼容Anthropic的端点兼容OpenAI的服务器模式(mlx_lm.server)
界面原生macOS菜单栏应用加Web管理仪表盘仅命令行,没有图形界面
编程代理集成为Claude Code、Cursor、OpenClaw等提供一键配置没有相关文档记录的功能;需要手动配置端点

如果你想要从脚本或简单的服务器命令运行单个MLX模型的最简单方式,单独使用mlx-lm或许就已足够。如果你想要一个带菜单栏界面的持久化多模型服务器、为长代理上下文提供SSD支持的缓存,以及一键式的编程代理集成,oMLX正是专为在mlx-lm之上添加这一层而设计的,而不是取代它。

谁适合使用oMLX?

oMLX是否适合你,几乎完全取决于一件最基本的事:你是否在使用Apple Silicon Mac,因为这个要求没有变通办法。

oMLX vs. 其他本地推理工具

oMLX处于本地推理领域中Apple Silicon/MLX的这一角落。以下是它与同一细分领域其他工具的对比——完整目录请见本地LLM软件目录,最直接的对比则见上文专门的oMLX与mlx-lm比较

  • mlx-lm — oMLX自身构建于其之上的底层Python库和CLI;如果你想在不使用完整服务器层的情况下,以最简单的方式运行单个MLX模型,这是正确的选择。请参见上文专门的对比部分。
  • exo — 一款开源工具,可将多台Apple Silicon Mac(及其他设备)组成集群,以运行单台机器无法容纳的更大模型;如果oMLX实验性的单集群分布式模式不足以满足你的配置需求,这会很相关。请参见exo评测
  • LM Studio — 一款跨平台(macOS、Windows、Linux)桌面应用,在Apple Silicon上也将MLX作为其推理引擎之一,与llama.cpp并存;如果你需要同一个工具也能在非Mac硬件上运行,它更合适。请参见LM Studio评测
  • llamafile — 一种基于llama.cpp而非MLX的单文件可执行本地推理方案,可在macOS、Windows和Linux上运行同一个文件而无需安装步骤;如果跨平台可移植性对你来说比Apple Silicon专属性能更重要,这是一个有用的对照。请参见llamafile详解一文。

评估oMLX时的常见误区

围绕oMLX的大多数困惑,源于假设它像跨平台工具一样运作、与同名分支混淆,或期望它支持Intel Mac。

常见问题

oMLX是什么?

oMLX(github.com/jundot/omlx)是一款面向Apple Silicon Mac的免费开源本地推理服务器。它通过Apple的MLX框架运行模型,以原生macOS菜单栏应用加omlx命令行工具和后台服务器的形式发布,并提供兼容OpenAI和Anthropic的API端点。

oMLX免费吗?

是的。无论是GitHub仓库还是omlx.ai都没有定价页面,LICENSE文件是未经修改的标准Apache License 2.0,没有任何付费层级。

oMLX能在Windows或Linux上运行吗?

不能。oMLX仅支持macOS,且专门需要Apple Silicon(M1至M5)以及macOS 15.0(Sequoia)或更高版本,因为它依赖于不面向Windows、Linux或Intel Mac的Apple MLX框架。

oMLX能在Intel Mac上运行吗?

不能。oMLX记录的系统要求只指定了Apple Silicon。它所构建的基础框架MLX不支持基于Intel的Mac。

oMLX与mlx-lm有什么不同?

mlx-lm是Apple MLX生态系统为运行模型而提供的底层Python库和轻量CLI;oMLX构建在mlx-lm的BatchGenerator之上,并新增了持久化服务器、菜单栏应用、分层SSD支持缓存、多模型管理以及兼容OpenAI/Anthropic的端点。详见上文的完整对比

oMLX中的分页SSD缓存有什么用?

它会将不活跃的键值缓存块以safetensors格式从RAM卸载到你Mac的SSD,而不是丢弃它们。当长时间运行的编程代理再次访问一个大型上下文时,oMLX可以从SSD恢复之前处理过的数据块,而不必由模型重新计算——根据其自身文档,这将长上下文的重新加载等待时间从数十秒缩短到几秒。

我可以将oMLX与Claude Code或Cursor一起使用吗?

可以。oMLX的管理仪表盘包含针对Claude Code、Cursor、OpenClaw、OpenCode、Codex、Hermes Agent、Copilot和Pi的一键集成配置,其API兼容这些工具所使用的OpenAI和Anthropic两种请求格式。

oMLX是开源的吗?它使用什么许可证?

是的。oMLX的LICENSE文件是未经修改的标准Apache License 2.0,带有"oMLX contributors"2025年的版权声明。

谁开发了oMLX?

oMLX由独立维护者jundot开发(仓库中列出的联系方式为junkim.dot@gmail.com)。本评测未发现该项目背后有公司或融资轮次的证据。

github.com/jundot/omlx是真正的oMLX仓库吗?

是的。其他GitHub用户名下存在多个名称完全相同的"omlx"仓库,但github.com/jundot/omlx是原始项目,这一点已由开发者本人在Apple MLX的GitHub讨论区上发布的公告确认。

资料来源

← 返回 本地LLM进阶