Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Shimmy Review 2026: una alternativa a Ollama en Rust de 5 MB
Overview & Reference

Shimmy Review 2026: una alternativa a Ollama en Rust de 5 MB

·10 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Shimmy es un servidor de inferencia gratuito, de código abierto y de un solo binario, escrito enteramente en Rust, que sirve modelos GGUF y SafeTensors locales a través de una API compatible con OpenAI, sin runtime de Python, sin cadena de herramientas de C++ y sin dependencia de llama.cpp. Creado y mantenido por Michael A. Kuykendall como un proyecto de código abierto independiente, mantenido por una sola persona, bajo licencia Apache-2.0, Shimmy se posiciona específicamente frente al binario mucho más grande de Ollama y su arranque en frío más lento: su propio README afirma que el binario ocupa unos pocos megabytes frente a una instalación de varios cientos de megabytes de Ollama.

Shimmy (github.com/Michael-A-Kuykendall/shimmy) es un servidor de inferencia gratuito, de código abierto y de un solo binario, escrito enteramente en Rust, posicionado como una alternativa ligera y sin dependencias a Ollama para servir modelos GGUF y SafeTensors locales a través de una API compatible con OpenAI. No necesita runtime de Python, ni cadena de herramientas de C++, ni dependencia de llama.cpp: el propio binario ocupa unos pocos megabytes en lugar de varios cientos. Esta review cubre qué hace realmente Shimmy, cómo se compara con Ollama y llama.cpp, cómo instalarlo y para quién es adecuado.

Conclusiones clave

  • Shimmy (github.com/Michael-A-Kuykendall/shimmy) es un servidor de inferencia gratuito, de código abierto y de un solo binario, no un IDE ni una app de chat
  • Creado y mantenido por Michael A. Kuykendall como un proyecto mantenido de forma independiente: su propio README declara "free forever" (gratis para siempre), sin evidencia de una empresa o ronda de financiación detrás
  • Con licencia Apache-2.0, según el propio archivo LICENSE del repositorio
  • Funciona sobre Airframe, su propio motor transformer WebGPU (WGSL) 100% Rust, evitando por completo una cadena de herramientas de C++ o una dependencia de llama.cpp
  • Sirve modelos GGUF y SafeTensors a través de una API compatible con OpenAI; la versión v2.6.2 añadió rutas compatibles con Ollama y con Anthropic
  • 5.890 estrellas en GitHub al momento de esta review (github.com/Michael-A-Kuykendall/shimmy, verificado vía la API de GitHub)

📍 En una frase

Shimmy es un servidor de inferencia local gratuito, de código abierto y de un solo binario, escrito enteramente en Rust —una alternativa ligera y sin dependencias a Ollama— que sirve modelos GGUF y SafeTensors a través de una API compatible con OpenAI, sin runtime de Python, sin cadena de herramientas de C++ y sin dependencia de llama.cpp, según el propio README del proyecto.

💬 En términos simples

En lugar de instalar el paquete de varios cientos de megabytes de Ollama, Shimmy es un único archivo ejecutable pequeño (unos pocos megabytes) que descargas o compilas con Cargo, apuntas a un archivo de modelo GGUF en tu disco y ejecutas. Cualquier herramienta que ya hable el formato de la API de OpenAI puede comunicarse con Shimmy en su lugar, sin cambios de código.

📌Nota: Esta review es el complemento en profundidad de la entrada de Shimmy en el Directorio de software de LLM local — consulta esa página para ver cómo se compara Shimmy de un vistazo con docenas de otras herramientas de IA local. Se basa en el propio README, changelog y notas de versión de Shimmy, no en benchmarks prácticos realizados por PromptQuorum.

¿Qué es Shimmy?

Shimmy es un servidor de inferencia de línea de comandos: un único binario que carga un archivo de modelo GGUF o SafeTensors local y lo expone a través de una API HTTP compatible con OpenAI. Su propia descripción en GitHub lo llama "pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary."

  • Tipo de producto: un servidor de línea de comandos, de un solo binario, no una app con GUI ni una extensión de IDE
  • Creador: Michael A. Kuykendall, un desarrollador independiente; esta review no encontró evidencia de una empresa, inversor o ronda de financiación detrás del proyecto
  • Repositorio: github.com/Michael-A-Kuykendall/shimmy
  • Licencia: Apache-2.0, confirmada vía el propio archivo LICENSE del repositorio
  • Escala: 5.890 estrellas en GitHub al momento de esta review, según la API de GitHub
  • Motor: Airframe, un motor transformer WebGPU (WGSL) 100% Rust al que el propio README de Shimmy atribuye el evitar por completo una cadena de herramientas de C++

Historia del proyecto Shimmy e hitos de versiones

Shimmy ha publicado versiones frecuentes e incrementales, y su propio CHANGELOG documenta casi 200 commits y un ritmo constante de versiones menores a lo largo de 2026, centradas en su pipeline propio de certificación de modelos y su motor de inferencia Airframe.

  1. 1
    v2.5.0 — 6 de agosto de 2026: motor Airframe actualizado a la 0.3.0
    Why it matters: Actualizó el motor transformer WebGPU 100% Rust subyacente sobre el que funciona Shimmy.
  2. 2
    v2.6.0 — 27 de agosto de 2026: pipeline de certificación consolidado
    Why it matters: Consolidó la certificación de modelos propia de Shimmy en un régimen "3-box" MATH + INFERENCE + DETERMINISM, certificando 26 combinaciones de modelo/cuantización en 12 familias de modelos, y eliminó unas 1.600 líneas de código de motor heredado.
  3. 3
    v2.6.1 — 28 de agosto de 2026: plantillas de chat unificadas
    Why it matters: Unificó todo el formateo de prompts a través de un módulo compartido prompt_render que usa plantillas de chat GGUF reales vía Jinja, y retiró una ruta de código de servidor GPU heredada (unas 1.847 líneas eliminadas).
  4. 4
    v2.6.2 — 28 de agosto de 2026: documentación OpenAPI y rutas compatibles adicionales
    Why it matters: Añadió un contrato de API legible por máquina (`GET /openapi.json`) y una interfaz Swagger interactiva (`GET /docs`), además de rutas compatibles con Ollama y con Anthropic junto a la API compatible con OpenAI ya existente.
  5. 5
    v2.6.3 — 29 de agosto de 2026: corrección de carga de modelos en GPU integradas
    Why it matters: Corrigió la carga de modelos en GPU integradas, incluyendo una corrección específica para GPU Intel Arc, actualizando la dependencia del motor Airframe a la 0.4.2.
  6. 6
    v2.6.4 — 30 de agosto de 2026: versión menor más reciente al momento de esta review
    Why it matters: La versión etiquetada más reciente encontrada en la página de releases de GitHub del proyecto al momento de esta review — consulta directamente [github.com/Michael-A-Kuykendall/shimmy/releases](https://github.com/Michael-A-Kuykendall/shimmy/releases) para cualquier novedad publicada después de la fecha de publicación de esta review.

¿Qué hace realmente Shimmy?

El conjunto de funciones de Shimmy se centra en servir modelos locales a través de una superficie de API familiar, manteniendo el binario en sí mínimo y sin dependencias, según el propio README de Shimmy.

  • Carga de modelos nativa en GGUF — carga archivos de modelo GGUF directamente, sin recompilar ni codificar constantes por modelo, según la propia documentación del proyecto; también es compatible con el formato SafeTensors
  • API compatible con OpenAI — chat completions, text completions, respuestas en streaming y endpoints de listado de modelos que coinciden con el formato de la API de OpenAI, de modo que el código de cliente y las herramientas OpenAI existentes pueden apuntar a Shimmy sin modificaciones
  • Rutas compatibles adicionales — desde la v2.6.2, Shimmy también expone rutas compatibles con Ollama y con Anthropic junto a su API compatible con OpenAI
  • Certificación de modelos propia — un régimen de pruebas "3-box" (MATH, INFERENCE, DETERMINISM) que Shimmy ejecuta sobre los modelos compatibles; el proyecto afirma que 26 combinaciones de modelo/cuantización en 12 familias de modelos pasan este régimen al momento de esta review
  • Compresión de caché KV INT4 TurboShimmy — la propia documentación de Shimmy describe un uso de memoria de caché KV aproximadamente 7 veces menor en configuraciones probadas, pensado para permitir ventanas de contexto más grandes o GPU más pequeñas para un modelo dado
  • Contexto extendido vía escalado YaRN RoPE — configurable mediante variables de entorno, según la documentación del proyecto
  • Sin dependencia de inferencia externa — Shimmy funciona sobre Airframe, su propio motor WebGPU 100% Rust, en lugar de envolver llama.cpp o requerir una cadena de herramientas Python/CUDA

Ejemplos de uso: tres formas de usar Shimmy

Estos son flujos de trabajo concretos construidos a partir de las funciones documentadas de Shimmy anteriores, no casos de uso hipotéticos.

Plataforma, precios y licencia

Plataforma

Lo que indica Shimmy:
Un servidor de línea de comandos, de un solo binario — funciona en macOS, Windows y Linux; sin instalador con GUI.

Costo

Lo que indica Shimmy:
Gratuito y de código abierto. El propio README del proyecto declara "Shimmy will be free forever" (Shimmy será gratis para siempre). No existe ningún nivel de pago.

Licencia

Lo que indica Shimmy:
Apache-2.0, confirmada vía el propio archivo LICENSE del repositorio.

Financiación

Lo que indica Shimmy:
Mantenido de forma independiente por Michael A. Kuykendall; el repositorio lista un programa de patrocinio voluntario (desde un nivel de 5 $/mes hasta un nivel de socio de infraestructura de 500 $/mes), no una ronda de financiación ni una empresa.

Verifica el estado actual de licencia y financiación directamente en github.com/Michael-A-Kuykendall/shimmy antes de basarte en esta tabla para una decisión de cumplimiento o riesgo de proveedor.

Shimmy vs. Ollama

Shimmy se posiciona directamente frente a Ollama; su propio README se autodenomina "the 5MB alternative to Ollama" (la alternativa de 5 MB a Ollama). Ambos sirven modelos locales a través de APIs HTTP similares; la diferencia está principalmente en el tamaño del binario, la huella de dependencias y el motor de inferencia de cada proyecto.

Tamaño del binario

Shimmy:
Unos pocos MB, según la propia afirmación del README de Shimmy
Ollama:
Varios cientos de MB, según comparativas de terceros

Motor de inferencia

Shimmy:
Airframe — su propio motor WebGPU (WGSL) 100% Rust
Ollama:
Construido sobre llama.cpp

Dependencias de runtime

Shimmy:
Ninguna — sin Python, sin cadena de herramientas de C++, según su README
Ollama:
Incluye su propio runtime; tampoco necesita Python por separado

Compatibilidad de API

Shimmy:
Compatible con OpenAI, además de rutas compatibles con Ollama y con Anthropic (v2.6.2+)
Ollama:
Tiene su propia API nativa más una capa compatible con OpenAI

Formato de modelo

Shimmy:
GGUF y SafeTensors
Ollama:
Basado en GGUF, a través de su propia biblioteca de modelos y el formato Modelfile

Mantenedor

Shimmy:
Desarrollador independiente en solitario
Ollama:
Ollama Inc., una empresa con financiación

Si el tamaño del binario, el tiempo de arranque en frío, o evitar específicamente llama.cpp son los factores decisivos, Shimmy está construido para ganar precisamente en esos ejes, según su propio posicionamiento. Si quieres la biblioteca de modelos existente más grande, herramientas de la comunidad, y una empresa con financiación detrás del mantenimiento a largo plazo, la trayectoria de Ollama está más consolidada — consulta la Ollama Review para un desglose completo. Verifica los benchmarks actuales por tu cuenta en lugar de confiar en el marketing de cualquiera de los dos proyectos.

¿Para quién es Shimmy?

Shimmy es adecuado para desarrolladores que quieren específicamente un servidor de inferencia de huella mínima y sin dependencias, y que están cómodos usando un proyecto aún joven, mantenido por una sola persona.

Competidores y alternativas

Dentro de los servidores de inferencia local ligeros, Shimmy es más directamente comparable a Ollama y llama.cpp — el motor sobre el que se construyen la mayoría de las herramientas locales, incluido Ollama — además de LMDeploy para equipos que evalúan opciones de servicio de mayor rendimiento.

Ollama

Conocida por:
El runtime de LLM local de un comando más adoptado, respaldado por una empresa con financiación
Artículos sobre Ollama (10)

+273 más no mostrados

llama.cpp

Conocida por:
El motor de inferencia en C/C++ sobre el que se construyen Ollama y muchas otras herramientas
Artículos sobre llama.cpp (10)

+140 más no mostrados

LMDeploy

Conocida por:
Servicio de LLM de alto rendimiento y cuantización, orientado a cargas de trabajo de producción
Artículos sobre LMDeploy (1)

También mencionado en:

Esta no es una lista exhaustiva de servidores de inferencia local — consulta el Directorio de software de LLM local para el catálogo completo, actualizado regularmente, que incluye la propia entrada de Shimmy en el directorio.

Errores comunes al evaluar Shimmy

La mayor parte de la confusión en torno a Shimmy proviene de confundirlo con proyectos homónimos no relacionados, o de asumir que tiene la escala de biblioteca de modelos de Ollama.

Preguntas frecuentes

¿Qué es Shimmy?

Shimmy (github.com/Michael-A-Kuykendall/shimmy) es un servidor de inferencia gratuito, de código abierto y de un solo binario, escrito enteramente en Rust, que sirve modelos GGUF y SafeTensors locales a través de una API compatible con OpenAI.

¿Shimmy es gratuito?

Sí. Shimmy es gratuito y de código abierto bajo la licencia Apache-2.0. Su propio README declara "Shimmy will be free forever" (Shimmy será gratis para siempre), sin ningún nivel de pago.

¿Cómo instalo Shimmy?

El método más sencillo, según el propio README del proyecto, es cargo install shimmy. También hay binarios de release precompilados y una configuración de Docker disponibles en el repositorio de GitHub.

¿En qué se diferencia Shimmy de Ollama?

El propio README de Shimmy lo describe como "the 5MB alternative to Ollama" (la alternativa de 5 MB a Ollama): un binario mucho más pequeño, sin runtime de Python ni cadena de herramientas de C++, que funciona sobre su propio motor Airframe en lugar de llama.cpp. Ollama tiene una biblioteca de modelos más grande y consolidada, y está respaldado por una empresa con financiación; Shimmy lo mantiene un único desarrollador independiente.

¿Shimmy usa llama.cpp?

No. Shimmy funciona sobre Airframe, su propio motor transformer WebGPU (WGSL) 100% Rust, que según el proyecto le permite evitar por completo una dependencia de llama.cpp o de una cadena de herramientas de C++.

¿Qué formatos de modelo admite Shimmy?

GGUF y SafeTensors, según la propia documentación del proyecto. Shimmy carga archivos GGUF directamente, sin recompilar ni codificar constantes por modelo.

¿La API de Shimmy es compatible con herramientas OpenAI?

Sí. Shimmy expone una API compatible con OpenAI (chat completions, text completions, streaming, listado de modelos). Desde la versión v2.6.2, también se añadieron rutas compatibles con Ollama y con Anthropic.

¿Quién creó Shimmy?

Michael A. Kuykendall creó y mantiene Shimmy como un proyecto de código abierto independiente, gestionado por una sola persona. Esta review no encontró evidencia de una empresa o ronda de financiación detrás.

¿Cuántos modelos admite Shimmy?

Al momento de esta review, Shimmy certifica 26 combinaciones específicas de modelo/cuantización en 12 familias de modelos mediante su propio régimen de pruebas "MATH + INFERENCE + DETERMINISM" — consulta el repositorio de GitHub del proyecto para la lista actual y actualizada.

¿PromptQuorum ha probado de forma independiente las afirmaciones de rendimiento de Shimmy?

Esta review se basa en el propio README, CHANGELOG y notas de versión de Shimmy, en lugar de en un benchmarking práctico del tiempo de arranque, la huella de memoria o la compresión de caché KV realizado por PromptQuorum.

Sources

← Volver a LLM locales avanzados