Conclusiones clave
- Shimmy (github.com/Michael-A-Kuykendall/shimmy) es un servidor de inferencia gratuito, de código abierto y de un solo binario, no un IDE ni una app de chat
- Creado y mantenido por Michael A. Kuykendall como un proyecto mantenido de forma independiente: su propio README declara "free forever" (gratis para siempre), sin evidencia de una empresa o ronda de financiación detrás
- Con licencia Apache-2.0, según el propio archivo LICENSE del repositorio
- Funciona sobre Airframe, su propio motor transformer WebGPU (WGSL) 100% Rust, evitando por completo una cadena de herramientas de C++ o una dependencia de llama.cpp
- Sirve modelos GGUF y SafeTensors a través de una API compatible con OpenAI; la versión v2.6.2 añadió rutas compatibles con Ollama y con Anthropic
- 5.890 estrellas en GitHub al momento de esta review (github.com/Michael-A-Kuykendall/shimmy, verificado vía la API de GitHub)
📍 En una frase
Shimmy es un servidor de inferencia local gratuito, de código abierto y de un solo binario, escrito enteramente en Rust —una alternativa ligera y sin dependencias a Ollama— que sirve modelos GGUF y SafeTensors a través de una API compatible con OpenAI, sin runtime de Python, sin cadena de herramientas de C++ y sin dependencia de llama.cpp, según el propio README del proyecto.
💬 En términos simples
En lugar de instalar el paquete de varios cientos de megabytes de Ollama, Shimmy es un único archivo ejecutable pequeño (unos pocos megabytes) que descargas o compilas con Cargo, apuntas a un archivo de modelo GGUF en tu disco y ejecutas. Cualquier herramienta que ya hable el formato de la API de OpenAI puede comunicarse con Shimmy en su lugar, sin cambios de código.
📌Nota: Esta review es el complemento en profundidad de la entrada de Shimmy en el Directorio de software de LLM local — consulta esa página para ver cómo se compara Shimmy de un vistazo con docenas de otras herramientas de IA local. Se basa en el propio README, changelog y notas de versión de Shimmy, no en benchmarks prácticos realizados por PromptQuorum.
¿Qué es Shimmy?
Shimmy es un servidor de inferencia de línea de comandos: un único binario que carga un archivo de modelo GGUF o SafeTensors local y lo expone a través de una API HTTP compatible con OpenAI. Su propia descripción en GitHub lo llama "pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary."
- Tipo de producto: un servidor de línea de comandos, de un solo binario, no una app con GUI ni una extensión de IDE
- Creador: Michael A. Kuykendall, un desarrollador independiente; esta review no encontró evidencia de una empresa, inversor o ronda de financiación detrás del proyecto
- Repositorio: github.com/Michael-A-Kuykendall/shimmy
- Licencia: Apache-2.0, confirmada vía el propio archivo LICENSE del repositorio
- Escala: 5.890 estrellas en GitHub al momento de esta review, según la API de GitHub
- Motor: Airframe, un motor transformer WebGPU (WGSL) 100% Rust al que el propio README de Shimmy atribuye el evitar por completo una cadena de herramientas de C++
Historia del proyecto Shimmy e hitos de versiones
Shimmy ha publicado versiones frecuentes e incrementales, y su propio CHANGELOG documenta casi 200 commits y un ritmo constante de versiones menores a lo largo de 2026, centradas en su pipeline propio de certificación de modelos y su motor de inferencia Airframe.
- 1v2.5.0 — 6 de agosto de 2026: motor Airframe actualizado a la 0.3.0
Why it matters: Actualizó el motor transformer WebGPU 100% Rust subyacente sobre el que funciona Shimmy. - 2v2.6.0 — 27 de agosto de 2026: pipeline de certificación consolidado
Why it matters: Consolidó la certificación de modelos propia de Shimmy en un régimen "3-box" MATH + INFERENCE + DETERMINISM, certificando 26 combinaciones de modelo/cuantización en 12 familias de modelos, y eliminó unas 1.600 líneas de código de motor heredado. - 3v2.6.1 — 28 de agosto de 2026: plantillas de chat unificadas
Why it matters: Unificó todo el formateo de prompts a través de un módulo compartido prompt_render que usa plantillas de chat GGUF reales vía Jinja, y retiró una ruta de código de servidor GPU heredada (unas 1.847 líneas eliminadas). - 4v2.6.2 — 28 de agosto de 2026: documentación OpenAPI y rutas compatibles adicionales
Why it matters: Añadió un contrato de API legible por máquina (`GET /openapi.json`) y una interfaz Swagger interactiva (`GET /docs`), además de rutas compatibles con Ollama y con Anthropic junto a la API compatible con OpenAI ya existente. - 5v2.6.3 — 29 de agosto de 2026: corrección de carga de modelos en GPU integradas
Why it matters: Corrigió la carga de modelos en GPU integradas, incluyendo una corrección específica para GPU Intel Arc, actualizando la dependencia del motor Airframe a la 0.4.2. - 6v2.6.4 — 30 de agosto de 2026: versión menor más reciente al momento de esta review
Why it matters: La versión etiquetada más reciente encontrada en la página de releases de GitHub del proyecto al momento de esta review — consulta directamente [github.com/Michael-A-Kuykendall/shimmy/releases](https://github.com/Michael-A-Kuykendall/shimmy/releases) para cualquier novedad publicada después de la fecha de publicación de esta review.
¿Qué hace realmente Shimmy?
El conjunto de funciones de Shimmy se centra en servir modelos locales a través de una superficie de API familiar, manteniendo el binario en sí mínimo y sin dependencias, según el propio README de Shimmy.
- Carga de modelos nativa en GGUF — carga archivos de modelo GGUF directamente, sin recompilar ni codificar constantes por modelo, según la propia documentación del proyecto; también es compatible con el formato SafeTensors
- API compatible con OpenAI — chat completions, text completions, respuestas en streaming y endpoints de listado de modelos que coinciden con el formato de la API de OpenAI, de modo que el código de cliente y las herramientas OpenAI existentes pueden apuntar a Shimmy sin modificaciones
- Rutas compatibles adicionales — desde la v2.6.2, Shimmy también expone rutas compatibles con Ollama y con Anthropic junto a su API compatible con OpenAI
- Certificación de modelos propia — un régimen de pruebas "3-box" (MATH, INFERENCE, DETERMINISM) que Shimmy ejecuta sobre los modelos compatibles; el proyecto afirma que 26 combinaciones de modelo/cuantización en 12 familias de modelos pasan este régimen al momento de esta review
- Compresión de caché KV INT4 TurboShimmy — la propia documentación de Shimmy describe un uso de memoria de caché KV aproximadamente 7 veces menor en configuraciones probadas, pensado para permitir ventanas de contexto más grandes o GPU más pequeñas para un modelo dado
- Contexto extendido vía escalado YaRN RoPE — configurable mediante variables de entorno, según la documentación del proyecto
- Sin dependencia de inferencia externa — Shimmy funciona sobre Airframe, su propio motor WebGPU 100% Rust, en lugar de envolver llama.cpp o requerir una cadena de herramientas Python/CUDA
Ejemplos de uso: tres formas de usar Shimmy
Estos son flujos de trabajo concretos construidos a partir de las funciones documentadas de Shimmy anteriores, no casos de uso hipotéticos.
Instalar Shimmy
Shimmy se instala como un binario Rust — vía Cargo, una descarga de release precompilada, o Docker.
Fuente | Enlace |
|---|---|
| Comando de instalación con Cargo | cargo install shimmy |
| Repositorio de GitHub (código fuente, Apache-2.0) | github.com/Michael-A-Kuykendall/shimmy |
| Binarios de release precompilados | github.com/Michael-A-Kuykendall/shimmy/releases |
| Ficha del paquete en crates.io | lib.rs/crates/shimmy |
Después de instalar, ejecuta shimmy serve --model-path /absolute/path/to/model.gguf --bind 127.0.0.1:11435 (según el propio README del proyecto) para empezar a servir un modelo local. También hay un Dockerfile y una configuración de Docker Compose disponibles en el repositorio para despliegues basados en contenedores. Verifica las instrucciones de instalación vigentes en el repositorio de GitHub antes de ejecutar cualquier comando, ya que los pasos de instalación pueden cambiar entre versiones.
Plataforma, precios y licencia
Plataforma
- Lo que indica Shimmy:
- Un servidor de línea de comandos, de un solo binario — funciona en macOS, Windows y Linux; sin instalador con GUI.
Costo
- Lo que indica Shimmy:
- Gratuito y de código abierto. El propio README del proyecto declara "Shimmy will be free forever" (Shimmy será gratis para siempre). No existe ningún nivel de pago.
Licencia
- Lo que indica Shimmy:
- Apache-2.0, confirmada vía el propio archivo LICENSE del repositorio.
Financiación
- Lo que indica Shimmy:
- Mantenido de forma independiente por Michael A. Kuykendall; el repositorio lista un programa de patrocinio voluntario (desde un nivel de 5 $/mes hasta un nivel de socio de infraestructura de 500 $/mes), no una ronda de financiación ni una empresa.
Verifica el estado actual de licencia y financiación directamente en github.com/Michael-A-Kuykendall/shimmy antes de basarte en esta tabla para una decisión de cumplimiento o riesgo de proveedor.
Shimmy vs. Ollama
Shimmy se posiciona directamente frente a Ollama; su propio README se autodenomina "the 5MB alternative to Ollama" (la alternativa de 5 MB a Ollama). Ambos sirven modelos locales a través de APIs HTTP similares; la diferencia está principalmente en el tamaño del binario, la huella de dependencias y el motor de inferencia de cada proyecto.
Tamaño del binario
- Shimmy:
- Unos pocos MB, según la propia afirmación del README de Shimmy
- Ollama:
- Varios cientos de MB, según comparativas de terceros
Motor de inferencia
- Shimmy:
- Airframe — su propio motor WebGPU (WGSL) 100% Rust
- Ollama:
- Construido sobre llama.cpp
Dependencias de runtime
- Shimmy:
- Ninguna — sin Python, sin cadena de herramientas de C++, según su README
- Ollama:
- Incluye su propio runtime; tampoco necesita Python por separado
Compatibilidad de API
- Shimmy:
- Compatible con OpenAI, además de rutas compatibles con Ollama y con Anthropic (v2.6.2+)
- Ollama:
- Tiene su propia API nativa más una capa compatible con OpenAI
Formato de modelo
- Shimmy:
- GGUF y SafeTensors
- Ollama:
- Basado en GGUF, a través de su propia biblioteca de modelos y el formato Modelfile
Mantenedor
- Shimmy:
- Desarrollador independiente en solitario
- Ollama:
- Ollama Inc., una empresa con financiación
Si el tamaño del binario, el tiempo de arranque en frío, o evitar específicamente llama.cpp son los factores decisivos, Shimmy está construido para ganar precisamente en esos ejes, según su propio posicionamiento. Si quieres la biblioteca de modelos existente más grande, herramientas de la comunidad, y una empresa con financiación detrás del mantenimiento a largo plazo, la trayectoria de Ollama está más consolidada — consulta la Ollama Review para un desglose completo. Verifica los benchmarks actuales por tu cuenta en lugar de confiar en el marketing de cualquiera de los dos proyectos.
¿Para quién es Shimmy?
Shimmy es adecuado para desarrolladores que quieren específicamente un servidor de inferencia de huella mínima y sin dependencias, y que están cómodos usando un proyecto aún joven, mantenido por una sola persona.
Competidores y alternativas
Dentro de los servidores de inferencia local ligeros, Shimmy es más directamente comparable a Ollama y llama.cpp — el motor sobre el que se construyen la mayoría de las herramientas locales, incluido Ollama — además de LMDeploy para equipos que evalúan opciones de servicio de mayor rendimiento.
Ollama
- Conocida por:
- El runtime de LLM local de un comando más adoptado, respaldado por una empresa con financiación
- Enlace:
- Ollama Review
Artículos sobre Ollama (10)
- Ollama Review 2026: The One-Command Local LLM RuntimeActualizado 12 de septiembre de 2026
- Cherry Studio 2.0 in 2026: The Free Agent-Based AI Desktop AppActualizado 20 de septiembre de 2026
- AutoGPT Review 2026: Classic Agent vs. Hosted PlatformActualizado 20 de septiembre de 2026
- KoboldCpp Review 2026: One File, No Install, Built for RoleplayActualizado 20 de septiembre de 2026
- llama.cpp Explained: The Engine Powering Ollama (2026)Actualizado 20 de septiembre de 2026
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026Actualizado 20 de septiembre de 2026
- Baserow Review 2026: A No-Code Database With a Local-AI FieldActualizado 19 de septiembre de 2026
- Farfalle Review: A Self-Hosted, Open-Source AI Search EngineActualizado 19 de septiembre de 2026
- little-coder Review: A Coding Agent CLI Built for Small Local ModelsActualizado 19 de septiembre de 2026
- Local Deep Research Review 2026: Self-Hosted, Cited AI Research AgentActualizado 19 de septiembre de 2026
+273 más no mostrados
llama.cpp
- Conocida por:
- El motor de inferencia en C/C++ sobre el que se construyen Ollama y muchas otras herramientas
- Enlace:
- llama.cpp Explained
Artículos sobre llama.cpp (10)
- llama.cpp Explained: The Engine Powering Ollama (2026)Actualizado 20 de septiembre de 2026
- KoboldCpp Review 2026: One File, No Install, Built for RoleplayActualizado 20 de septiembre de 2026
- little-coder Review: A Coding Agent CLI Built for Small Local ModelsActualizado 19 de septiembre de 2026
- Local Deep Research Review 2026: Self-Hosted, Cited AI Research AgentActualizado 19 de septiembre de 2026
- mlx-serve Review 2026: Native Zig Inference Server for Apple SiliconActualizado 19 de septiembre de 2026
- mlxcel Review: Rust-Native MLX Inference RuntimeActualizado 19 de septiembre de 2026
- Parlor Review: On-Device Real-Time Voice and Vision AIActualizado 19 de septiembre de 2026
- Rapid-MLX Review: Native MLX Inference Server for Apple SiliconActualizado 19 de septiembre de 2026
- Shimmy Review 2026: A 5MB Rust Alternative to OllamaActualizado 19 de septiembre de 2026
- Sidekick Review 2026: A Free, Native macOS Local AI Chat AppActualizado 19 de septiembre de 2026
+140 más no mostrados
LMDeploy
- Conocida por:
- Servicio de LLM de alto rendimiento y cuantización, orientado a cargas de trabajo de producción
- Enlace:
- LMDeploy Review
Artículos sobre LMDeploy (1)
- LMDeploy Review: High-Throughput LLM Serving and QuantizationActualizado 19 de septiembre de 2026
También mencionado en:
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingActualizado 19 de septiembre de 2026
- LoRAX Review: Serving Thousands of LoRA Adapters on One GPUActualizado 19 de septiembre de 2026
- Shimmy Review 2026: A 5MB Rust Alternative to OllamaActualizado 19 de septiembre de 2026
- TurboFieldfare Review: Running Gemma 4 26B-A4B in 2 GB of RAMActualizado 19 de septiembre de 2026
Esta no es una lista exhaustiva de servidores de inferencia local — consulta el Directorio de software de LLM local para el catálogo completo, actualizado regularmente, que incluye la propia entrada de Shimmy en el directorio.
Errores comunes al evaluar Shimmy
La mayor parte de la confusión en torno a Shimmy proviene de confundirlo con proyectos homónimos no relacionados, o de asumir que tiene la escala de biblioteca de modelos de Ollama.
Preguntas frecuentes
¿Qué es Shimmy?
Shimmy (github.com/Michael-A-Kuykendall/shimmy) es un servidor de inferencia gratuito, de código abierto y de un solo binario, escrito enteramente en Rust, que sirve modelos GGUF y SafeTensors locales a través de una API compatible con OpenAI.
¿Shimmy es gratuito?
Sí. Shimmy es gratuito y de código abierto bajo la licencia Apache-2.0. Su propio README declara "Shimmy will be free forever" (Shimmy será gratis para siempre), sin ningún nivel de pago.
¿Cómo instalo Shimmy?
El método más sencillo, según el propio README del proyecto, es cargo install shimmy. También hay binarios de release precompilados y una configuración de Docker disponibles en el repositorio de GitHub.
¿En qué se diferencia Shimmy de Ollama?
El propio README de Shimmy lo describe como "the 5MB alternative to Ollama" (la alternativa de 5 MB a Ollama): un binario mucho más pequeño, sin runtime de Python ni cadena de herramientas de C++, que funciona sobre su propio motor Airframe en lugar de llama.cpp. Ollama tiene una biblioteca de modelos más grande y consolidada, y está respaldado por una empresa con financiación; Shimmy lo mantiene un único desarrollador independiente.
¿Shimmy usa llama.cpp?
No. Shimmy funciona sobre Airframe, su propio motor transformer WebGPU (WGSL) 100% Rust, que según el proyecto le permite evitar por completo una dependencia de llama.cpp o de una cadena de herramientas de C++.
¿Qué formatos de modelo admite Shimmy?
GGUF y SafeTensors, según la propia documentación del proyecto. Shimmy carga archivos GGUF directamente, sin recompilar ni codificar constantes por modelo.
¿La API de Shimmy es compatible con herramientas OpenAI?
Sí. Shimmy expone una API compatible con OpenAI (chat completions, text completions, streaming, listado de modelos). Desde la versión v2.6.2, también se añadieron rutas compatibles con Ollama y con Anthropic.
¿Quién creó Shimmy?
Michael A. Kuykendall creó y mantiene Shimmy como un proyecto de código abierto independiente, gestionado por una sola persona. Esta review no encontró evidencia de una empresa o ronda de financiación detrás.
¿Cuántos modelos admite Shimmy?
Al momento de esta review, Shimmy certifica 26 combinaciones específicas de modelo/cuantización en 12 familias de modelos mediante su propio régimen de pruebas "MATH + INFERENCE + DETERMINISM" — consulta el repositorio de GitHub del proyecto para la lista actual y actualizada.
¿PromptQuorum ha probado de forma independiente las afirmaciones de rendimiento de Shimmy?
Esta review se basa en el propio README, CHANGELOG y notas de versión de Shimmy, en lugar de en un benchmarking práctico del tiempo de arranque, la huella de memoria o la compresión de caché KV realizado por PromptQuorum.