Conclusiones clave
- Gratuito, de código abierto, licencia Apache-2.0, copyright de Exo Technologies Ltd, según el archivo LICENSE propio del repositorio — verificado el 12/09/2026
- Descubrimiento automático de dispositivos — los dispositivos que ejecutan exo en la misma red se encuentran sin configuración manual, según el propio README de exo
- Modo auto-paralelo consciente de la topología: exo reparte el modelo entre los dispositivos según una vista en tiempo real de los recursos de cada uno y la latencia/ancho de banda de los enlaces de red
- Paralelismo tensorial además del sharding — hasta 1,8x de aceleración en 2 dispositivos y 3,2x en 4 dispositivos, según el propio README de exo
- Soporte de RDMA sobre Thunderbolt 5 (macOS 26.2+), que exo describe como una reducción del 99 % en la latencia entre dispositivos, según su propia documentación
- Usa MLX, el framework de computación de arrays de Apple, como backend de inferencia y MLX distributed para la comunicación entre dispositivos
- Compatible con las API de OpenAI Chat Completions, OpenAI Responses, Claude Messages y Ollama, por lo que los clientes existentes pueden apuntar a un clúster exo prácticamente sin cambios
- 47.375 estrellas en GitHub, 3.508 forks, verificado mediante la API de GitHub el 12/09/2026
- macOS (Apple Silicon) es la plataforma principal y probada; Linux hoy solo funciona con CPU (el soporte de GPU figura como "en desarrollo" en el propio PLATFORMS.md de exo); Windows no es compatible actualmente
📍 En una frase
exo es un framework gratuito y de código abierto (Apache-2.0) que agrupa varios Mac Apple Silicon — y, con soporte limitado a CPU, máquinas Linux — en un único clúster de inferencia distribuida, usando descubrimiento automático de dispositivos y sharding consciente de la topología para ejecutar modelos demasiado grandes para un solo dispositivo.
💬 En términos simples
En lugar de comprar un equipo muy caro con suficiente memoria para cargar un modelo enorme, o alquilar tiempo de GPU en la nube, exo permite conectar por red varios Mac (o equipos Linux) que ya posee para que actúen como un ordenador más grande, repartiendo automáticamente las capas del modelo entre todos ellos.
📌Nota: Esta review es el complemento de la entrada de exo en el directorio de software de IA local — consulte esa página para ver de un vistazo cómo se compara exo con docenas de otras herramientas de IA local.
¿Qué es exo?
exo es un framework que conecta varios dispositivos que ya posee en un clúster de inferencia de IA, de modo que modelos demasiado grandes para la memoria de un solo dispositivo puedan ejecutarse igualmente, repartiendo el modelo entre el grupo. Lo mantiene exo labs y la descripción de su propio repositorio se resume en: "Run frontier AI locally".
- Función principal: descubrimiento automático de dispositivos más sharding de modelo consciente de la topología — apunte varios dispositivos al mismo clúster y exo determina cómo repartir el modelo entre ellos
- Backend de inferencia: MLX, el framework de código abierto de Apple para computación de arrays, usado tanto para ejecutar el modelo como para la capa de comunicación MLX distributed entre dispositivos
- Modelo de implementación: desde el código fuente (macOS o Linux), mediante el gestor de paquetes Nix, o — solo macOS — como una app en segundo plano instalable con Homebrew o un archivo
.dmgdescargable - Desarrollador: exo-explore / exo labs en GitHub; el archivo LICENSE del repositorio indica a Exo Technologies Ltd como titular del copyright
- Repositorio canónico: github.com/exo-explore/exo, creado en junio de 2024 según los propios metadatos del repositorio en GitHub, con un push registrado tan reciente como el 25/08/2026 en el momento de esta review
Instalar exo: opciones de configuración
El propio README de exo documenta tres formas de ejecutarlo: compilar desde el código fuente en macOS o Linux, ejecutarlo mediante el gestor de paquetes Nix, o — solo en macOS — instalar una app prediseñada en segundo plano. No existe un paquete pip install exo; las instalaciones desde código fuente usan uv para las dependencias de Python.
- Esto inicia el panel de exo y la API compatible con OpenAI en
http://localhost:52415, según el propio README de exo - En Linux, los comandos equivalentes usan
uv sync --extra mlx-cpu(o--extra mlx-cuda13/--extra mlx-cuda12cuando corresponda); el propio README de exo indica que en Linux, exo actualmente funciona solo con CPU, con soporte de GPU "en desarrollo" - Si Nix ya está instalado,
nix run .#exoevita la mayoría de los pasos manuales de configuración de dependencias en macOS - En macOS, exo también incluye una app prediseñada en segundo plano que requiere macOS Tahoe 26.2 o posterior — instálela con
brew install --cask exoo descargue directamente EXO-latest.dmg, según la propia documentación de exo - Existen dos opciones de configuración para las instalaciones desde código fuente, según el README:
--no-worker(ejecutar solo un nodo coordinador, sin inferencia local — útil para un equipo con buena conectividad de red pero GPU/memoria limitadas) y--legacy-daemon(ejecutar como demonio en segundo plano para sistemas de inicio más antiguos)
git clone https://github.com/exo-explore/exo
cd exo/dashboard && npm install && npm run build && cd ..
uv sync --extra mlx
uv run exoCómo funciona realmente el clustering de exo
El propio README de exo documenta cuatro mecanismos que, juntos, permiten que un grupo de dispositivos independientes se comporte como un único clúster de inferencia, sin que usted tenga que decidir manualmente qué capas se ejecutan dónde.
- Advertencias propias de exo sobre RDMA: cada dispositivo del clúster debe estar conectado directamente a todos los demás con cables certificados Thunderbolt 5, y todos los dispositivos deben ejecutar exactamente la misma versión de macOS, incluidos los números de compilación beta
- Un indicador
--no-workerpermite que un dispositivo se una al clúster solo como coordinador, sin ejecutar inferencia localmente — útil para un equipo con buena conectividad de red pero poca capacidad de cómputo - La variable de entorno
EXO_OFFLINEejecuta un clúster sin conexión a internet, usando solo los modelos ya almacenados en caché localmente
Modelos y plataformas compatibles
exo carga modelos desde Hugging Face Hub a través de su backend de inferencia MLX, y el propio README de exo no documenta soporte para modelos en formato GGUF — lo que lo distingue de herramientas basadas en llama.cpp como Ollama o LM Studio, que priorizan GGUF.
Rendimiento: qué muestran los benchmarks
El propio README de exo enlaza a benchmarks de terceros en lugar de publicar cifras propias para cada configuración; PromptQuorum no ha reproducido estas pruebas de forma independiente y las reporta aquí como fuentes citadas por el propio exo, no como mediciones propias de PromptQuorum.
- El README de exo muestra una captura del panel de 4 Mac Studio M3 Ultra de 512 GB ejecutando simultáneamente DeepSeek V3.1 (8 bits) y Kimi-K2-Thinking (4 bits), como ilustración de la agrupación de memoria que permite exo
- Un benchmark citado del blog de Jeff Geerling cubre Qwen3-235B (8 bits) ejecutado en 4 Mac Studio M3 Ultra con RDMA en paralelismo tensorial
- La misma fuente citada cubre también DeepSeek V3.1 671B (8 bits) y Kimi K2 Thinking (nativo 4 bits) en la misma configuración de clúster de 4 dispositivos
- El propio README de exo indica los multiplicadores generales de hasta 1,8x (2 dispositivos) y 3,2x (4 dispositivos) específicamente del paralelismo tensorial, por separado de los benchmarks de terceros para modelos grandes mencionados arriba
Ejemplos de uso
Estos son flujos de trabajo construidos a partir de las funciones documentadas de exo mencionadas arriba, no casos de uso hipotéticos.
¿Para quién es exo?
Que exo sea adecuado depende en gran medida del hardware que ya posea y de si pertenece al ecosistema macOS — el clustering de exo está construido y probado primero en torno a Apple Silicon.
exo frente a otras herramientas de inferencia distribuida
exo se ubica en el segmento de inferencia local distribuida/en clúster, junto a otros proyectos que reparten un modelo entre varias máquinas en lugar de servirlo desde una sola. Así se compara: consulte el directorio de software de IA local para el catálogo completo.
- GPUStack — un gestor de clústeres de GPU de código abierto (Apache-2.0) que agrupa GPU en Linux, Windows y macOS y puede servir modelos usando Ollama, vLLM o llama.cpp como backends; un gestor de clústeres más amplio y agnóstico del backend, frente al diseño específico de MLX y centrado en Apple Silicon de exo. GPUStack tiene su propia entrada en el directorio de software de IA local de PromptQuorum.
- El backend RPC de llama.cpp — llama.cpp incluye un
ggml-rpc-serverexperimental que delega el cómputo a hosts remotos para inferencia distribuida; sus propios mantenedores lo califican de "proof-of-concept" "fragile and insecure" y advierten que nunca debe exponerse en una red abierta, una postura de madurez y seguridad muy distinta del clustering documentado de exo. - Petals — un proyecto de investigación del taller BigScience que ejecuta modelos grandes "al estilo BitTorrent" sobre un enjambre público de GPU de consumo gestionado por voluntarios, en lugar de un clúster privado de dispositivos propios; un modelo de confianza distinto del clustering en red local de exo, orientado a inferencia colaborativa sobre hardware ajeno en vez de su propia red local.
Errores comunes al evaluar exo
La mayor parte de la confusión sobre exo viene de tratarlo como una app de chat de un solo dispositivo, o de esperar que Linux/Windows igualen las funciones de macOS.
Preguntas frecuentes
¿Qué es exo?
exo (exolabs.net, código fuente en github.com/exo-explore/exo) es un framework de código abierto, con licencia Apache-2.0, que conecta varios dispositivos — principalmente Mac Apple Silicon — en un único clúster de inferencia de IA distribuida, de modo que modelos demasiado grandes para un solo dispositivo puedan ejecutarse igualmente repartiéndose entre el grupo.
¿Es gratis exo?
Sí. exo es de código abierto bajo licencia Apache-2.0, verificada frente al propio archivo LICENSE del repositorio — no hay un nivel de pago separado ni restricción de uso más allá de las condiciones estándar de Apache-2.0.
¿Qué licencia usa exo? ¿Ha cambiado?
exo tiene licencia Apache License 2.0, copyright de Exo Technologies Ltd, según el archivo LICENSE actual del repositorio, comprobado directamente el 12/09/2026. PromptQuorum no encontró ninguna restricción de uso adicional más allá del texto estándar de Apache-2.0 en el repositorio actual.
¿Cómo funciona realmente el clustering de exo?
Según el propio README de exo, los dispositivos que ejecutan exo se descubren automáticamente en la misma red, exo construye una vista en tiempo real de la memoria de cada dispositivo y los enlaces de red entre ellos, y reparte las capas de un modelo por el clúster en consecuencia, añadiendo paralelismo tensorial para una aceleración adicional. En hardware macOS compatible, puede además usar RDMA sobre Thunderbolt 5 para enlaces de menor latencia entre dispositivos.
¿Qué formatos de modelo admite exo?
El propio README de exo documenta la carga de modelos desde Hugging Face Hub mediante su backend de inferencia MLX; no documenta soporte para modelos en formato GGUF, lo que lo distingue de herramientas GGUF-first como llama.cpp u Ollama.
¿Funciona exo en Windows?
Actualmente no. El propio PLATFORMS.md de exo solo lista el soporte de Windows CUDA y Windows CPU bajo un encabezado de hoja de ruta "Longer term", separado de sus planes a corto plazo.
¿Funciona exo en Linux?
Sí, pero hoy solo con CPU. El propio README y PLATFORMS.md de exo dejan claro que el soporte de GPU para Linux (CUDA y Vulkan) está en desarrollo y aún no se ha entregado, en el momento de esta review.
¿Cómo instalo exo?
Compile desde el código fuente con git clone https://github.com/exo-explore/exo, construya el panel, ejecute uv sync --extra mlx (macOS) o uv sync --extra mlx-cpu (Linux), y luego uv run exo. En macOS, también puede instalar una app en segundo plano prediseñada con brew install --cask exo o descargando EXO-latest.dmg — requiere macOS Tahoe 26.2 o posterior.
¿Cuántas estrellas de GitHub tiene exo?
exo tenía 47.375 estrellas y 3.508 forks en GitHub, verificado mediante la API de GitHub el 12/09/2026. Consulte el repositorio en vivo para la cifra actual, ya que el número de estrellas cambia continuamente.
¿Quién desarrolla exo?
exo lo desarrolla exo-explore / exo labs en GitHub; el archivo LICENSE del repositorio indica a Exo Technologies Ltd como titular del copyright. El repositorio se creó en junio de 2024, según los propios metadatos de GitHub.
