Conclusiones clave
- Licencia AGPL 3.0 — de uso gratuito, con obligación de copyleft si se modifica y redistribuye como servicio de red
- Construido sobre llama.cpp (licencia MIT) por debajo, con interfaz propia y funciones añadidas encima
- Un ejecutable por plataforma: Windows, Linux x64, macOS ARM64 — sin instalador
- KoboldAI Lite, la interfaz web integrada, está pensada para escritura narrativa y rol: salida editable, campos de memoria/world-info y varios modos de chat/aventura
- Aceleración por GPU vía CUDA (NVIDIA) o Vulkan (multiplataforma, vía recomendada para AMD); existe un build ROCm continuo para Linux; el funcionamiento solo con CPU también está totalmente soportado
- Incluye además generación de imágenes con Stable Diffusion y transcripción de voz con Whisper en el mismo ejecutable
📍 En una frase
KoboldCpp es una aplicación de LLM local gratuita, con licencia AGPL 3.0, de un solo archivo, construida sobre llama.cpp, que ejecuta modelos GGUF sin instalación y trae la interfaz web KoboldAI Lite para escritura narrativa y rol.
💬 En términos simples
Descarga un archivo, haz doble clic, y se abre una pestaña del navegador con una interfaz de chat y edición narrativa ya integrada — sin instalador aparte, sin configuración por línea de comandos, sin necesidad de otra app encima.
📌Nota: La única fuente oficial de descarga es la página de GitHub Releases. Un archivo con el mismo nombre alojado en otro sitio no se puede verificar como el build auténtico.
¿Qué es KoboldCpp?
KoboldCpp es un programa gratuito de un solo archivo que ejecuta modelos de lenguaje en formato GGUF localmente, construido sobre el motor de inferencia llama.cpp y mantenido por un desarrollador seudónimo conocido como LostRuins. Hereda las convenciones de interfaz del proyecto original KoboldAI, adaptadas para funcionar sobre el backend de llama.cpp en lugar de una pila de inferencia basada en Python.
El proyecto se aloja en github.com/LostRuins/koboldcpp y se publica bajo la GNU Affero General Public License versión 3 (AGPL 3.0), una licencia copyleft, distinta de la licencia MIT permisiva que usa llama.cpp por debajo. Las versiones se publican con frecuencia; la vigente al momento de la revisión (finales de agosto de 2026) era la v1.120.
- Se distribuye como un ejecutable por plataforma — koboldcpp.exe (Windows), koboldcpp-linux-x64 (Linux), koboldcpp-mac-arm64 (macOS Apple Silicon)
- No requiere instalador, entorno Python ni Docker para ejecutarse
- Usa llama.cpp para la inferencia del modelo en sí, y añade su propio servidor, interfaz web y capa de API encima
- Ofrece un build nocuda (sin CUDA, compatible con Vulkan) y un build oldpc (CUDA11 + AVX1) para hardware antiguo, además del build principal con CUDA
¿Qué es KoboldAI Lite y qué aporta de más?
KoboldAI Lite es la interfaz web integrada directamente en el ejecutable de KoboldCpp: se abre automáticamente en una pestaña del navegador en cuanto arranca el servidor, sin un paso de instalación aparte. Está diseñada específicamente para la escritura larga y el rol, no solo para un chat de turnos.
- Salida editable: el texto generado se puede editar directamente, no solo regenerar, algo importante para la escritura colaborativa
- Campos Memory y World Info: bloques de contexto persistentes que el modelo siempre ve, usados para mantener coherentes los detalles de un personaje o los hechos de una historia a lo largo de una sesión larga
- Varios modos: chat estándar, un modo "Story" para ficción colaborativa y un modo "Adventure" al estilo de las aventuras de texto
- Controles de Author's Note y formato instruct para orientar el tono y el estilo sin editar a mano la plantilla de prompt subyacente
- Funciona íntegramente desde el mismo ejecutable y el mismo servidor local — no hace falta una app frontend ni extensión de navegador aparte
¿Cómo se descarga y ejecuta KoboldCpp?
Descarga el archivo correcto para tu plataforma desde la página oficial de GitHub Releases y ejecútalo directamente — no hay paso de instalación. Elegir el build adecuado para tu hardware es la única decisión real.
- 1Entra en la página de Releases de KoboldCpp en GitHub — la única fuente oficial de descarga.
- 2Elige el build de tu plataforma: koboldcpp.exe para Windows, koboldcpp-linux-x64 para Linux, o koboldcpp-mac-arm64 para macOS en Apple Silicon.
- 3Elige tu vía de GPU: el build principal incluye soporte CUDA de NVIDIA; para AMD, el proyecto recomienda probar primero la opción Vulkan del build nocuda; existe un build ROCm continuo aparte para Linux; el hardware antiguo sin juegos de instrucciones modernos debe usar el build oldpc (CUDA11 + AVX1).
- 4Descarga un archivo de modelo GGUF (por ejemplo desde Hugging Face) si aún no tienes uno.
- 5Ejecuta el binario, selecciona el archivo GGUF y una cantidad de descarga de capas a la GPU en la ventana de inicio, y arranca el servidor.
- 6Se abre automáticamente una pestaña del navegador con la interfaz KoboldAI Lite, ya conectada al servidor local en ejecución.
¿KoboldCpp requiere instalación?
No. Es un único ejecutable: se descarga y se ejecuta directamente. No hay instalador, ni entorno Python aparte, ni contenedor Docker de por medio.
¿Puede KoboldCpp funcionar sin GPU?
Sí. El funcionamiento solo con CPU está totalmente soportado; una GPU (vía CUDA, Vulkan o ROCm) solo acelera la velocidad de generación, nunca es obligatoria.
¿Qué GPU y hardware admite KoboldCpp?
KoboldCpp admite configuraciones NVIDIA, AMD y solo CPU mediante variantes de build separadas, en lugar de un único binario universal que detecte todo automáticamente. Elegir el build que coincide con tu hardware es necesario para que funcione la aceleración por GPU.
- NVIDIA — la aceleración CUDA viene integrada en los binarios de la versión principal
- AMD — el propio proyecto recomienda probar primero el backend Vulkan del build nocuda, por su compatibilidad más amplia; también se mantiene un binario ROCm continuo aparte para Linux
- Multiplataforma — el backend Vulkan también funciona en gráficas Intel y tarjetas NVIDIA/AMD más antiguas sin controladores específicos
- Hardware antiguo — el build oldpc apunta a CUDA 11 y CPU solo con AVX1, para equipos que no pueden ejecutar el build estándar moderno
- Solo CPU — el build nocuda funciona sin ninguna GPU, a velocidad reducida frente a la inferencia acelerada por GPU
¿Para quién es KoboldCpp?
Usa KoboldCpp si la escritura narrativa, el rol o un único archivo sin instalación importan más que el rendimiento bruto o la huella mínima; usa otra cosa si necesitas servicio de producción multiusuario o la descarga más pequeña posible.
¿Cómo se compara KoboldCpp con Ollama y otras herramientas locales?
Las comparaciones más cercanas a KoboldCpp son otras herramientas construidas sobre llama.cpp, además de los motores de producción pensados para un trabajo completamente distinto.
Herramienta | Licencia | Mejor para |
|---|---|---|
| KoboldCpp | AGPL 3.0 | Sin instalación, UI de rol/escritura integrada |
| llama.cpp | MIT | Mayor soporte de hardware, control directo |
| Ollama | MIT | CLI/API sencilla, gestión de modelos |
| LM Studio | Propietaria (gratis) | GUI de escritorio sin terminal |
| vLLM | Apache 2.0 | Servicio multiusuario de alto rendimiento |
| text-generation-webui | AGPL 3.0 | Personalización profunda de UI, muchos backends |
Errores comunes al evaluar KoboldCpp
La mayoría de las confusiones vienen de tratar KoboldCpp como una app instalada convencional, o de descargarlo de una fuente no oficial.
Preguntas frecuentes
¿Qué es KoboldCpp?
KoboldCpp es una aplicación de LLM local gratuita, de un solo archivo, construida sobre llama.cpp. Ejecuta modelos GGUF sin paso de instalación y trae la interfaz web KoboldAI Lite, pensada para escritura narrativa y rol.
¿Quién mantiene KoboldCpp?
KoboldCpp lo mantiene un desarrollador seudónimo conocido como LostRuins, en el repositorio github.com/LostRuins/koboldcpp. Las versiones se publican con frecuencia; la v1.120 estaba vigente a finales de agosto de 2026.
¿Es gratis KoboldCpp?
Sí. KoboldCpp es gratuito y de código abierto bajo licencia AGPL 3.0. No hay nivel de pago ni producto alojado: cada despliegue de KoboldCpp corre en hardware que tú controlas.
¿Bajo qué licencia se publica KoboldCpp?
AGPL 3.0 (GNU Affero General Public License versión 3), una licencia copyleft. Difiere de la licencia MIT que usa llama.cpp, el motor sobre el que se construye por debajo.
¿Requiere instalación KoboldCpp?
No. Se distribuye como un ejecutable único por plataforma (Windows, Linux, macOS ARM64) — se descarga y se ejecuta directamente, sin instalador, entorno Python ni contenedor Docker.
¿Admite KoboldCpp GPU de AMD?
Sí, aunque no mediante el build CUDA principal. El proyecto recomienda la opción Vulkan dentro del build nocuda como primera vía para AMD, junto con un build ROCm continuo mantenido aparte para Linux.
¿Qué es KoboldAI Lite?
KoboldAI Lite es la interfaz web incluida en el ejecutable de KoboldCpp. Se abre automáticamente en el navegador en cuanto arranca el servidor, con salida editable, campos de memoria/world-info y modos dedicados de chat, story y adventure para rol y escritura colaborativa.
¿Puede KoboldCpp generar imágenes o transcribir voz?
Sí. El mismo ejecutable incluye generación de imágenes con Stable Diffusion y transcripción de voz con Whisper, además de su función principal de generación de texto.
¿Sirve KoboldCpp para producción o uso multiusuario?
No, ese no es su objetivo de diseño. KoboldCpp está construido para uso local de un solo usuario con una interfaz de escritura rica; para servicio de producción multiusuario de alta concurrencia, vLLM o NVIDIA TensorRT-LLM son las herramientas adecuadas.
¿En qué se diferencia KoboldCpp de Ollama?
Ambos se apoyan en llama.cpp, pero Ollama apuesta por una CLI mínima y un registro de modelos sin interfaz integrada, mientras que KoboldCpp trae una interfaz completa de escritura y rol en el navegador (KoboldAI Lite) dentro del mismo ejecutable único.
