Conclusiones clave
- SwiftLM (github.com/SharpAI/SwiftLM) es un servidor de inferencia nativo en Swift, gratuito y de código abierto, para modelos MLX — no es un IDE ni un paquete de Python
- Con licencia MIT, confirmado en los metadatos de licencia del repositorio de GitHub
- Solo macOS 14.0+ en Apple Silicon (de M1 a M5), según la propia sección de Requisitos del repositorio — sin compatibilidad con Windows, Linux o Mac con Intel
- Desarrollado por SharpAI, una organización de Silicon Valley cuya biografía en GitHub describe su negocio principal como aplicar machine learning a cámaras de videovigilancia CCTV/NVR tradicionales
- Sirve una API estrictamente compatible con OpenAI (
/v1/chat/completions,/v1/models,/health) para que el código cliente de OpenAI existente pueda apuntar directamente a él - Admite modelos de visión y lenguaje (mediante
--vision) y, para algunas variantes de Gemma-4, entrada de audio y lenguaje (mediante--audio) - Incluye streaming de expertos desde SSD para modelos Mixture-of-Experts sobredimensionados y compresión de la caché KV con TurboQuant para inferencia de contexto largo
- Incluye SwiftBuddy, una app complementaria gratuita y de código abierto para iOS/iPadOS que descarga modelos MLX desde HuggingFace y los ejecuta en el dispositivo
- 768 estrellas y 53 forks en GitHub al momento de esta reseña (18-09-2026); repositorio creado el 21 de marzo de 2026, con lanzamientos aproximadamente cada 1–2 días en las semanas previas a esta reseña
📍 En una frase
SwiftLM es un servidor de inferencia nativo en Swift, gratuito y de código abierto (MIT), para Apple Silicon, que sirve modelos MLX a través de una API estrictamente compatible con OpenAI sin entorno de ejecución Python, y se distribuye con una app complementaria para iOS/iPadOS llamada SwiftBuddy.
💬 En términos simples
SwiftLM es un programa de línea de comandos que ejecutas en un Mac con Apple Silicon, que carga un modelo de IA y permite que otras apps se comuniquen con él igual que lo harían con los servidores de OpenAI — solo que todo se ejecuta en tu propia máquina, compilado directamente a código Metal nativo en lugar de pasar por Python. Una app complementaria para iPhone/iPad, SwiftBuddy, hace algo similar directamente en tu teléfono.
📌Nota: Esta reseña es el análisis en profundidad complementario a la ficha de SwiftLM en el Directorio de Software de LLM Local — consulta esa página para ver cómo se compara SwiftLM de un vistazo con docenas de otras herramientas de IA local. Se basa en el propio repositorio de GitHub, el README y el historial de lanzamientos de SwiftLM, no en pruebas de rendimiento independientes de PromptQuorum sobre las cifras publicadas por SharpAI.
¿Qué es SwiftLM?
SwiftLM es un servidor de inferencia, escrito íntegramente en Swift, que carga modelos de IA en formato MLX y los sirve a través de una API HTTP estrictamente compatible con OpenAI — una alternativa nativa a los servidores basados en Python como mlx-lm. Su propia descripción en GitHub lo resume como "Native MLX Swift LLM inference server for Apple Silicon" (servidor de inferencia LLM nativo en Swift con MLX para Apple Silicon), y se compila en un único binario autocontenido en lugar de requerir un entorno Python, un gestor de entornos virtuales o un instalador de paquetes.
- Función principal: un servidor HTTP local que carga un modelo MLX a la vez y lo expone a través de endpoints de chat-completion compatibles con OpenAI
- Lenguaje de implementación: Swift, compilado con kernels de Metal para el cómputo en GPU — sin Python, y sin Global Interpreter Lock (GIL) que limite las solicitudes concurrentes
- Desarrollador: SharpAI, una organización con sede en Silicon Valley presente en GitHub desde febrero de 2018, cuya propia biografía describe su trabajo principal como llevar machine learning a cámaras de videovigilancia CCTV/NVR tradicionales
- Framework subyacente: el framework de arrays MLX de Apple, a través de forks propios (
SharpAI/mlx,SharpAI/mlx-c) que añaden ejecución fuera de núcleo (out-of-core) mapeada en memoria que SharpAI indica que aún no está disponible en los repositorios oficiales deml-explore - Licencia: MIT, confirmada en los metadatos de licencia del repositorio
- Escala: 768 estrellas, 53 forks y 12 colaboradores en GitHub al momento de esta reseña
¿Quién desarrolla SwiftLM y a qué ritmo avanza?
SwiftLM es un proyecto joven y de rápido movimiento: su repositorio de GitHub se creó el 21 de marzo de 2026, y en la fecha de publicación de esta reseña había lanzado versiones etiquetadas aproximadamente cada uno o dos días durante las semanas anteriores.
- Repositorio creado: 21 de marzo de 2026 — unos seis meses de antigüedad al momento de esta reseña
- Ritmo de lanzamientos reciente: las compilaciones etiquetadas b703 a b711 se publicaron entre el 27 de agosto de 2026 y el 5 de septiembre de 2026, un promedio de alrededor de un lanzamiento cada 1,4 días en ese período
- Organización: SharpAI, creada en GitHub en febrero de 2018, con sede en Silicon Valley según su perfil de GitHub
- Negocio principal: según la propia biografía de SharpAI en GitHub, el enfoque principal de la organización es "empoderar cámaras CCTV/NVR y de videovigilancia tradicionales con tecnologías de machine learning" — SwiftLM en sí no es un producto de videovigilancia, sino un servidor de inferencia de propósito general que SharpAI ha publicado como código abierto
- Colaboradores: 12 al momento de esta reseña, incluyendo trabajo de ingeniería reconocido en el streaming de expertos desde SSD y la compresión de caché KV de TurboQuant
- Forks propios de MLX: SharpAI mantiene
SharpAI/mlxySharpAI/mlx-c, forks del framework MLX oficial de Apple, para admitir la ejecución fuera de núcleo mapeada en memoria que el README indica que aún no está disponible en el proyecto original
¿Qué puedes hacer con SwiftLM?
El conjunto de funciones de SwiftLM se centra en servir modelos MLX de la forma más rápida y eficiente en memoria posible en Apple Silicon, con varias funciones orientadas específicamente a ejecutar modelos demasiado grandes para caber cómodamente en la memoria unificada. Esto es lo que hace cada parte, según el propio README de GitHub de SwiftLM.
- Servicio compatible con OpenAI — expone los endpoints
/v1/chat/completions,/v1/modelsy/health, de modo que los SDKs y herramientas cliente de OpenAI existentes pueden apuntar a SwiftLM como backend local intercambiable - Amplia compatibilidad con familias de modelos — el README enumera compatibilidad nativa con más de 30 familias de modelos, incluyendo Gemma 4/3, Qwen 3.5/3/2.5, Llama 3.x, Mistral/Mixtral, Phi 4/3, DeepSeek V3, GLM 4, Falcon H1 y varias familias de investigación más pequeñas
- Modelos de visión y lenguaje (VLM) — se ejecutan con el flag
--vision, con análisis en tiempo real de imágenes en base64 para modelos como Qwen2-VL, Qwen2.5-VL y PaliGemma - Modelos de audio y lenguaje (ALM) — se ejecutan con el flag
--audiopara algunas variantes "Omni" de Gemma-4, decodificando payloadsinput_audiocon la especificación de OpenAI mediante extracción WAV con AVFoundation - Compresión de caché KV con TurboQuant — un esquema propio de cuantización no lineal (codebook Lloyd-Max) de clase 3-bit para la caché KV de atención, que los propios benchmarks de SharpAI reportan como aproximadamente 3,5 veces más pequeño que FP16 con una pérdida de precisión casi nula, activado con
--turbo-kv - Streaming de expertos desde SSD — para modelos Mixture-of-Experts, transmite las capas de expertos inactivas desde SSD NVMe en lugar de requerir el modelo completo en RAM, activado con
--stream-experts; las propias pruebas de SharpAI cubren modelos de hasta 69,6 GB (Qwen3.5-122B-A10B) y 209 GB (Qwen3.5-397B-A22B) en un Mac de 64 GB - Decodificación especulativa y Multi-Token Prediction (MTP) — acelera la inferencia en RAM ya sea mediante un modelo borrador pequeño independiente (
--draft-model) o, en modelos con cabezales MTP nativos como la familia Qwen3, sin necesitar ninguno - Control granular de memoria — flags como
--gpu-layersy--prefill-sizepermiten ajustar cuánto de un modelo reside en la GPU frente a cómo se fragmentan los prompts durante el prefill
Ejemplos de uso: tres formas de usar SwiftLM
Estos son flujos de trabajo concretos construidos a partir de los flags y endpoints documentados de SwiftLM anteriores — no son casos de uso hipotéticos.
Instalar SwiftLM
SwiftLM se instala de forma gratuita, ya sea como binario precompilado para macOS o compilado desde el código fuente, y tanto su código fuente como el de la app SwiftBuddy para iOS están en GitHub.
Fuente | Enlace |
|---|---|
| Repositorio de GitHub (código fuente, licencia MIT) | github.com/SharpAI/SwiftLM |
| Binario precompilado para macOS arm64 | Página de Releases |
Compilar desde el código fuente (./build.sh) | Instrucciones de compilación |
| Código de la app SwiftBuddy para iOS/iPadOS (compilar en Xcode) | Directorio de SwiftBuddy |
| Modelos en formato MLX | huggingface.co/mlx-community |
Según la propia sección de Requisitos del repositorio, SwiftLM necesita macOS 14.0+ en Apple Silicon (M1–M5), las Xcode Command Line Tools y el Metal Toolchain (instalable mediante xcodebuild -downloadComponent MetalToolchain). SwiftBuddy no se distribuye a través de la App Store al momento de esta reseña — compilarla requiere Xcode y tu propia cuenta de Apple Developer, ya que su .xcodeproj está excluido de git y se regenera localmente mediante generate_xcodeproj.py.
Precios y licencia de SwiftLM
SwiftLM es gratuito, sin ningún tipo de plan de pago. Tanto SwiftLM como su app complementaria SwiftBuddy tienen licencia MIT, confirmada en los metadatos de licencia del repositorio de GitHub — una licencia de código abierto permisiva sin requisito de atribución más allá de mantener el aviso de copyright, y sin obligaciones de copyleft.
- Sin suscripción, sin plan de pago, sin límites de uso impuestos por el propio SwiftLM
- No se requiere cuenta ni registro para ejecutar el servidor ni la app SwiftBuddy
- La licencia MIT se aplica a todo el repositorio, incluido SwiftBuddy, según los metadatos de licencia del repositorio de GitHub
- El único costo real es el hardware: SwiftLM requiere un Mac con Apple Silicon y macOS 14.0 o posterior — no funciona en Macs con Intel, Windows ni Linux
SwiftLM vs. Ollama
SwiftLM y Ollama ejecutan ambos modelos de peso abierto de forma local detrás de una API compatible con OpenAI, pero priorizan cosas distintas — Ollama optimiza para una amplia compatibilidad de hardware y un ecosistema existente grande, mientras que SwiftLM se centra estrechamente en el máximo rendimiento en Apple Silicon y la eficiencia en contextos largos.
Aspecto | SwiftLM | Ollama |
|---|---|---|
| Motor | Swift nativo, compilado a Metal vía MLX | Wrapper en Go sobre un núcleo llama.cpp/GGML en C++ |
| Plataformas | macOS 14+, solo Apple Silicon, más app complementaria para iOS | macOS, Windows, Linux, Docker; Intel y Apple Silicon |
| Dependencia de runtime | Ninguna — un único binario nativo, sin Python | Ninguna — también un único binario nativo, sin Python |
| Formato de modelo | Safetensors de HuggingFace vía MLX (builds de mlx-community) | GGUF a través de su propia biblioteca de modelos y sistema Modelfile |
| Compresión de KV en contexto largo | TurboQuant, ~3,5x más pequeño que FP16 (--turbo-kv) | Sin flag dedicado de compresión KV al momento de esta reseña |
| Modelos MoE sobredimensionados | Streaming de expertos desde SSD ejecuta modelos MoE de 100B+ más allá de la RAM | Depende del mapeo de memoria estándar del SO, sin modo de streaming dedicado |
| Madurez | 768 estrellas en GitHub, repositorio creado en marzo de 2026 | Proyecto consolidado con una base de instalación y ecosistema mucho más grandes |
Esta comparación refleja las funciones documentadas públicamente en el repositorio de GitHub de cada proyecto, no pruebas de rendimiento independientes de PromptQuorum sobre el rendimiento real de ninguna de las dos herramientas. Si necesitas compatibilidad multiplataforma (Windows o Linux) o el ecosistema de integraciones más grande, Ollama es la opción más consolidada; si trabajas exclusivamente en Apple Silicon y quieres aprovechar al máximo el rendimiento nativo en Swift y el ahorro de memoria en contextos largos, SwiftLM merece una evaluación directa.
¿Quién debería usar SwiftLM?
Que SwiftLM te convenga depende en gran medida de tu hardware — es exclusivo de Apple Silicon — y de cuánto valores el rendimiento nativo en Swift y la eficiencia de memoria en contextos largos frente a la madurez del ecosistema.
Competidores y alternativas
SwiftLM se sitúa en un campo pequeño pero en crecimiento de servidores de inferencia MLX nativos y sin Python para Apple Silicon — mira cómo se compara con otras herramientas de ese mismo segmento, además de la implementación de referencia en Python frente a la que se posiciona.
Tool | Best known for | Link |
|---|---|---|
| oMLX | Servidor de inferencia MLX con app nativa de menú de macOS y caché KV escalonada en RAM+SSD | Reseña de oMLX |
| Rapid-MLX | Servidor de inferencia MLX nativo que también sirve generación local de imagen, video y audio | Reseña de Rapid-MLX |
| vLLM (backend MLX) | Servidor de inferencia de alto rendimiento, con una opción de backend MLX para Apple Silicon | Reseña de vLLM MLX |
| mlx-lm | Biblioteca de referencia en Python de la propia Apple para ejecutar LLMs en MLX | mlx-lm explicado |
Esta no es una lista exhaustiva de herramientas de inferencia para Apple Silicon — consulta el Directorio de Software de LLM Local para ver el catálogo completo y actualizado periódicamente, incluida la propia ficha de SwiftLM en el directorio.
Errores comunes al evaluar SwiftLM
La mayor parte de la confusión sobre SwiftLM surge de confundirlo con proyectos no relacionados que tienen nombres similares, o de asumir que funciona en hardware que explícitamente no admite.
Preguntas frecuentes
¿Qué es SwiftLM?
SwiftLM (github.com/SharpAI/SwiftLM) es un servidor de inferencia nativo en Swift, gratuito y de código abierto (MIT), que ejecuta modelos de IA en formato MLX en Macs con Apple Silicon a través de una API estrictamente compatible con OpenAI, sin necesidad de entorno de ejecución Python.
¿SwiftLM es gratuito?
Sí. Tanto SwiftLM como su app complementaria SwiftBuddy son gratuitos y tienen licencia MIT, confirmada en los metadatos de licencia del repositorio de GitHub. No hay página de precios, cuenta ni plan de pago.
¿Cuáles son los requisitos del sistema para SwiftLM?
Según la propia sección de Requisitos del repositorio: macOS 14.0 o posterior, un Mac con Apple Silicon (de M1 a M5), las Xcode Command Line Tools y el Metal Toolchain. No existe compilación para Windows, Linux ni Mac con Intel.
¿Cómo instalo SwiftLM?
Descarga un binario precompilado para macOS arm64 desde la página de Releases de GitHub del proyecto y ejecútalo directamente, o clona el repositorio y ejecuta ./build.sh para compilarlo desde el código fuente, según el README oficial.
¿Qué es SwiftBuddy?
SwiftBuddy es la app complementaria gratuita y de código abierto de SwiftLM para iPhone y iPad, que descarga modelos MLX desde HuggingFace y los ejecuta directamente en el dispositivo mediante MLX Swift. Su código fuente está dentro del repositorio de SwiftLM; se compila y ejecuta a través de Xcode en lugar de distribuirse en la App Store, al momento de esta reseña.
¿SwiftLM admite entrada de visión o audio?
Sí. Iniciar SwiftLM con el flag --vision habilita modelos de visión y lenguaje como Qwen2-VL y PaliGemma, y el flag --audio habilita la entrada de audio para algunas variantes "Omni" de Gemma-4, según el README oficial.
¿Qué es TurboQuant?
TurboQuant es el esquema propio de compresión de caché KV de SwiftLM, que combina codebooks no lineales de Lloyd-Max con una implementación acelerada por hardware en Metal. Los propios benchmarks de SharpAI reportan que comprime la caché KV a aproximadamente 3,5 veces menos tamaño que FP16 con una pérdida de precisión casi nula, activado con el flag --turbo-kv.
¿Qué es el streaming de expertos desde SSD?
Es una función que transmite las capas inactivas de Mixture-of-Experts directamente desde SSD NVMe a la GPU en lugar de requerir que el modelo completo resida en memoria unificada, activada con --stream-experts. Las propias pruebas de SharpAI cubren modelos de hasta 209 GB ejecutándose en un Mac de 64 GB.
¿Quién desarrolla SwiftLM?
SwiftLM es desarrollado por SharpAI, una organización con sede en Silicon Valley presente en GitHub desde 2018, cuyo negocio principal declarado es aplicar machine learning a sistemas de videovigilancia CCTV/NVR. SwiftLM es un servidor de inferencia de propósito general que la organización ha publicado como código abierto de forma separada a ese negocio principal.
¿Cómo se compara SwiftLM con Ollama?
Ambos sirven modelos locales detrás de una API compatible con OpenAI, pero Ollama admite macOS, Windows y Linux con un ecosistema mucho más grande, mientras que SwiftLM es exclusivo de Apple Silicon y añade funciones nativas de MLX como la compresión KV de TurboQuant y el streaming de expertos desde SSD para modelos MoE sobredimensionados. Consulta la comparativa dedicada SwiftLM vs. Ollama más arriba.
¿PromptQuorum ha verificado de forma independiente las afirmaciones de rendimiento de SwiftLM?
Esta reseña se basa en el propio repositorio de GitHub, el README y el historial de lanzamientos de SwiftLM, no en pruebas de rendimiento independientes de PromptQuorum sobre las cifras publicadas por SharpAI.