Skip to main content
PromptQuorum
主页/本地LLM进阶/exo评测:跨多设备的分布式AI推理
Overview & Reference

exo评测:跨多设备的分布式AI推理

·11分钟阅读·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

exo是一个免费开源(Apache-2.0许可)框架,可将多台设备——主要是Apple Silicon Mac,目前Linux仅支持CPU——连接成单一的分布式推理集群,通过自动发现网络上的其他设备并将大模型的层拆分到所有设备上,从而运行单台设备无法承载的模型。 它使用苹果公司的数组计算框架MLX作为推理后端并用于设备间通信,在此基础上加入张量并行以进一步提速,并且在运行macOS 26.2或更高版本、配备Thunderbolt 5的Mac上,支持通过Thunderbolt实现RDMA,以降低集群成员之间的连接延迟。exo暴露了兼容OpenAI Chat Completions、OpenAI Responses、Claude Messages和Ollama的API,因此大多数现有的本地AI客户端无需修改即可指向exo集群。

exo(exolabs.net,源代码位于github.com/exo-explore/exo)是由exo labs维护的免费开源框架,可将多台日常设备——主要是Apple Silicon Mac,Linux目前仅支持CPU——连接成单一的分布式推理集群,让你把模型拆分到已经拥有的硬件上运行单台设备装不下的模型。本评测是exo在本地LLM软件目录中条目的配套文章,涵盖exo的集群机制实际如何运作、许可证、支持的平台和模型格式,以及它相对于GPUStackllama.cpp的RPC后端Petals等其他分布式/集群推理工具的定位。

exo评测:跨多设备的分布式AI推理

关键要点

  • 免费、开源、Apache-2.0许可证,版权归Exo Technologies Ltd所有,依据仓库自身的LICENSE文件——已于2026年9月12日核实
  • 自动设备发现——根据exo自身的README,在同一网络中运行exo的设备无需手动配置即可互相发现
  • 拓扑感知的自动并行模式:exo根据每台设备资源以及网络链路延迟/带宽的实时视图,决定如何在设备间拆分模型
  • 在分片基础上加入张量并行——根据exo自身的README,2台设备最高可提速1.8倍,4台设备可提速3.2倍
  • 支持通过Thunderbolt 5实现RDMA(macOS 26.2+),exo自身的文档称可将设备间延迟降低99%
  • 使用苹果公司的数组计算框架MLX作为推理后端,并使用MLX distributed进行设备间通信
  • 兼容OpenAI Chat Completions、OpenAI Responses、Claude Messages和Ollama API,现有客户端基本无需修改即可指向exo集群
  • 通过GitHub API于2026年9月12日核实,获得47,375个GitHub星标、3,508个复刻
  • macOS(Apple Silicon)是主要且经过测试的平台;Linux目前仅能以CPU方式运行(GPU支持在exo自身的PLATFORMS.md中标注为"开发中");Windows目前不受支持

📍 简单一句话

exo是一个免费开源(Apache-2.0)框架,能将多台Apple Silicon Mac——以及仅支持CPU的Linux机器——汇集成单一的分布式推理集群,利用自动设备发现和拓扑感知的模型分片来运行单台设备无法承载的模型。

💬 简单来说

与其购买一台内存足够加载庞大模型的极昂贵机器,或租用云端GPU时间,exo可以让你通过网络连接已经拥有的多台Mac(或Linux机器),使它们如同一台更强大的电脑一样协同工作,自动将模型的层拆分到所有设备上。

📌: 本评测是exo在本地LLM软件目录中条目的配套文章——请前往该页面一览exo与其他数十款本地AI工具的对比。

exo是什么?

exo是一个框架,可将你已经拥有的多台设备连接成一个AI推理集群,使单台设备内存无法容纳的模型能够通过将模型拆分到整个组内的方式运行。 它由exo labs维护,其仓库自身的描述很简单:"Run frontier AI locally."(在本地运行前沿AI)。

  • 核心功能:自动设备发现加上拓扑感知的模型分片——把多台设备指向同一个集群,exo会自行决定如何拆分模型
  • 推理后端:苹果公司的开源数组计算框架MLX,既用于运行模型,也用于设备间的MLX distributed通信层
  • 部署方式:从源码构建(macOS或Linux)、通过Nix包管理器,或——仅限macOS——作为可通过Homebrew或可下载的.dmg安装的后台应用
  • 开发方:GitHub上的exo-explore / exo labs;仓库的LICENSE文件将Exo Technologies Ltd列为版权所有者
  • 权威仓库:github.com/exo-explore/exo,根据GitHub自身的仓库元数据创建于2024年6月,截至本评测撰写时,最近一次推送记录为2026年8月25日

安装exo:设置方式

exo自身的README记录了三种运行方式:在macOS或Linux上从源码构建、通过Nix包管理器运行,或者——仅限macOS——安装预构建的后台应用。 不存在pip install exo这样的软件包;源码安装使用uv管理Python依赖。

  • 根据exo自身的README,这会在http://localhost:52415启动exo仪表盘和兼容OpenAI的API
  • 在Linux上,对应的命令使用uv sync --extra mlx-cpu(视情况也可用--extra mlx-cuda13/--extra mlx-cuda12);exo自身的README指出,exo在Linux上目前仅以CPU方式运行,GPU支持"正在开发中"
  • 如果已安装Nix,nix run .#exo可以跳过macOS上大部分手动依赖配置步骤
  • 在macOS上,exo还提供预构建的后台应用,需要macOS Tahoe 26.2或更高版本——根据exo自身的文档,可通过brew install --cask exo安装,或直接下载EXO-latest.dmg
  • 根据README,源码安装存在两个配置标志:--no-worker(仅以协调节点方式运行,不进行本地推理——适合网络连接良好但GPU/内存有限的机器)和--legacy-daemon(为较旧的init系统以后台守护进程方式运行)
bash
git clone https://github.com/exo-explore/exo
cd exo/dashboard && npm install && npm run build && cd ..
uv sync --extra mlx
uv run exo

exo的集群机制实际如何运作

exo自身的README记录了四种机制,它们共同使一组独立的设备能够表现得像单一推理集群,而无需你手动决定哪些层在哪里运行。

  • exo自身对RDMA的注意事项:集群中的每台设备都必须使用Thunderbolt 5认证线缆与所有其他设备直接相连,且所有设备必须运行完全相同的macOS版本,包括测试版构建号
  • --no-worker标志允许设备仅作为协调节点加入集群,而不在本地运行推理——适合网络连接强但计算能力弱的机器
  • EXO_OFFLINE环境变量可让集群在无互联网连接的情况下运行,仅使用已在本地缓存的模型

支持的模型与平台

exo通过其MLX推理后端从Hugging Face Hub加载模型,exo自身的README并未记录对GGUF格式模型的支持——这使它区别于以GGUF优先的、基于llama.cpp的工具,如Ollama或LM Studio。

性能:基准测试显示了什么

exo自身的README链接到第三方基准测试,而不是为每种配置发布自己的数字;PromptQuorum并未独立重新运行这些测试,此处仅作为exo自身引用的来源转述,而非PromptQuorum自身的测量结果。

  • exo的README展示了一张仪表盘截图,显示4台配备512GB内存的M3 Ultra Mac Studio同时运行DeepSeek V3.1(8比特)和Kimi-K2-Thinking(4比特),用以说明exo实现的内存池化效果
  • 来自Jeff Geerling博客的一项被引用的基准测试,展示了在4台M3 Ultra Mac Studio上使用张量并行RDMA运行Qwen3-235B(8比特)的情况
  • 同一引用来源还涵盖了在相同的4设备集群配置下运行DeepSeek V3.1 671B(8比特)和Kimi K2 Thinking(原生4比特)的情况
  • exo自身的README指出,张量并行带来的一般加速倍数为最高1.8倍(2台设备)和3.2倍(4台设备),这与上述第三方大模型基准测试是分开报告的

使用示例

以下是基于上述exo文档记录功能构建的工作流程,并非假设性用例。

谁适合使用exo?

exo是否合适,很大程度上取决于你已经拥有的硬件,以及它是否基于macOS——exo的集群机制首先是围绕Apple Silicon构建和测试的。

exo与其他分布式推理工具对比

exo属于分布式/集群本地推理这一细分领域,与其他将模型拆分到多台机器而非从单台机器提供服务的项目并列。以下是对比情况——完整目录请参见本地LLM软件目录

  • GPUStack ——一个开源GPU集群管理器(Apache-2.0),可跨Linux、Windows和macOS汇集GPU,并可使用Ollama、vLLM或llama.cpp作为后端提供模型服务;相比exo专属于MLX、以Apple Silicon为先的设计,GPUStack是一个更广泛、与后端无关的集群管理器。GPUStack在PromptQuorum的本地LLM软件目录中有自己的条目。
  • llama.cpp的RPC后端 ——llama.cpp提供了一个实验性的ggml-rpc-server,可将计算卸载到远程主机以实现分布式推理;其维护者自己将其称为"proof-of-concept"(概念验证),"fragile and insecure"(脆弱且不安全),并警告切勿将其暴露在开放网络上,这与exo已记录的集群机制在成熟度和安全姿态上有着显著差异。
  • Petals ——BigScience workshop的一个研究项目,以"类似BitTorrent"的方式在由志愿者运营的公共消费级GPU群体上运行大模型,而非在你自己拥有设备组成的私有集群上运行;这与exo基于局域网的集群模式是不同的信任模型,其面向的是在陌生人硬件上进行协作推理,而非你自己的本地网络。

评估exo时的常见误区

关于exo的大多数误解,都源于把它当作单设备聊天应用来对待,或者期望Linux/Windows能与macOS的功能集持平。

常见问题

exo是什么?

exo(exolabs.net,源代码位于github.com/exo-explore/exo)是一个采用Apache-2.0许可的开源框架,可将多台设备——主要是Apple Silicon Mac——连接成单一的分布式AI推理集群,使单台设备无法承载的模型能够通过拆分到整个组来运行。

exo是免费的吗?

是的。exo在Apache-2.0许可证下开源,已对照仓库自身的LICENSE文件核实——除标准Apache-2.0条款外,不存在单独的付费等级或使用限制。

exo使用什么许可证?是否变更过?

exo采用Apache License 2.0许可,版权归Exo Technologies Ltd所有,依据仓库当前的LICENSE文件,已于2026年9月12日直接核实。PromptQuorum在当前仓库中未发现超出标准Apache-2.0文本的额外使用限制。

exo的集群机制实际如何运作?

根据exo自身的README,运行exo的设备会在同一网络中自动互相发现,exo会构建每台设备的内存以及设备间网络链路的实时视图,并据此将模型的层拆分到整个集群,再加入张量并行以进一步提速。在支持的macOS硬件上,还可以额外使用通过Thunderbolt 5实现的RDMA来降低设备间连接延迟。

exo支持哪些模型格式?

exo自身的README记录了通过其MLX推理后端从Hugging Face Hub加载模型;并未记录对GGUF格式模型的支持,这使它区别于llama.cpp或Ollama等以GGUF优先的工具。

exo能在Windows上运行吗?

目前不能。exo自身的PLATFORMS.md仅在"Longer term"(长期)路线图标题下列出Windows CUDA和Windows CPU支持,与其短期计划分开。

exo能在Linux上运行吗?

可以,但目前仅支持CPU。exo自身的README和PLATFORMS.md明确指出,截至本评测撰写时,Linux的GPU支持(CUDA和Vulkan)仍在开发中,尚未交付。

如何安装exo?

使用git clone https://github.com/exo-explore/exo从源码构建,构建仪表盘,运行uv sync --extra mlx(macOS)或uv sync --extra mlx-cpu(Linux),然后运行uv run exo。在macOS上,你也可以通过brew install --cask exo安装预构建的后台应用,或下载EXO-latest.dmg——需要macOS Tahoe 26.2或更高版本。

exo有多少GitHub星标?

截至2026年9月12日通过GitHub API核实,exo拥有47,375个星标和3,508个复刻。由于星标数量持续变化,请查看实时仓库获取当前数字。

exo由谁开发?

exo由GitHub上的exo-explore / exo labs开发;仓库的LICENSE文件将Exo Technologies Ltd列为版权所有者。根据GitHub自身的元数据,该仓库创建于2024年6月。

资料来源

← 返回 本地LLM进阶