Principais conclusões
- Licença AGPL 3.0 — uso gratuito, com obrigação de copyleft se modificado e redistribuído como serviço de rede
- Construído sobre o llama.cpp (licença MIT) por baixo, com interface própria e funções adicionadas em cima
- Um executável por plataforma: Windows, Linux x64, macOS ARM64 — sem instalador
- O KoboldAI Lite, a interface web embutida, é feito para escrita de histórias e roleplay: saída editável, campos de memória/world-info e vários modos de chat/aventura
- Aceleração por GPU via CUDA (NVIDIA) ou Vulkan (multiplataforma, caminho recomendado para AMD); existe um build ROCm contínuo para Linux; o funcionamento só com CPU também é totalmente suportado
- Também inclui geração de imagens com Stable Diffusion e transcrição de voz com Whisper no mesmo executável
📍 Em uma frase
O KoboldCpp é uma aplicação de LLM local gratuita, com licença AGPL 3.0, em um único arquivo, construída sobre o llama.cpp, que roda modelos GGUF sem instalação e traz a interface web KoboldAI Lite para escrita de histórias e roleplay.
💬 Em termos simples
Baixe um arquivo, dê dois cliques, e uma aba do navegador abre com chat e edição de histórias já integrados — sem instalador separado, sem configuração de linha de comando, sem precisar de outro app por cima.
📌Nota: A única fonte oficial de download é a página de GitHub Releases. Um arquivo com o mesmo nome hospedado em outro site não pode ser verificado como o build genuíno.
O que é o KoboldCpp?
O KoboldCpp é um programa gratuito de arquivo único que roda modelos de linguagem em formato GGUF localmente, construído sobre o motor de inferência llama.cpp e mantido por um desenvolvedor pseudônimo conhecido como LostRuins. Ele herda as convenções de interface do projeto KoboldAI original, adaptadas para rodar sobre o backend do llama.cpp em vez de uma stack de inferência baseada em Python.
O projeto está hospedado em github.com/LostRuins/koboldcpp e é publicado sob a GNU Affero General Public License versão 3 (AGPL 3.0) — uma licença copyleft, diferente da licença MIT permissiva que o próprio llama.cpp usa por baixo. As versões saem com frequência; a vigente no momento do teste (final de agosto de 2026) era a v1.120.
- Distribuído como um executável por plataforma — koboldcpp.exe (Windows), koboldcpp-linux-x64 (Linux), koboldcpp-mac-arm64 (macOS Apple Silicon)
- Não exige instalador, ambiente Python nem Docker para rodar
- Usa o llama.cpp para a inferência do modelo em si, e adiciona por cima seu próprio servidor, interface web e camada de API
- Oferece um build nocuda (sem CUDA, compatível com Vulkan) e um build oldpc (CUDA11 + AVX1) para hardware antigo, além do build principal com CUDA
O que é o KoboldAI Lite, e o que ele acrescenta?
O KoboldAI Lite é a interface web embutida diretamente no executável do KoboldCpp — ela abre automaticamente em uma aba do navegador assim que o servidor inicia, sem etapa de instalação separada. É construída especificamente para escrita longa e roleplay, não apenas chat em turnos.
- Saída editável: o texto gerado pode ser editado diretamente, não só regenerado — importante para escrita colaborativa de histórias
- Campos Memory e World Info: blocos de contexto persistentes que o modelo sempre vê, usados para manter detalhes de personagens ou fatos da história consistentes ao longo de uma sessão longa
- Vários modos: chat padrão, um modo "Story" para ficção colaborativa e um modo "Adventure" no estilo de jogos de aventura em texto
- Controles de Author's Note e formatação instruct para direcionar tom e estilo sem editar manualmente o template de prompt subjacente
- Roda inteiramente a partir do mesmo executável e do mesmo servidor local — sem precisar de um app frontend ou extensão de navegador separados
Como baixar e rodar o KoboldCpp?
Baixe o arquivo correto para sua plataforma na página oficial de GitHub Releases e rode diretamente — não existe etapa de instalação. Escolher o build certo para o seu hardware é a única decisão real envolvida.
- 1Acesse a página de Releases do KoboldCpp no GitHub — a única fonte de download oficial.
- 2Escolha o build da sua plataforma: koboldcpp.exe para Windows, koboldcpp-linux-x64 para Linux, ou koboldcpp-mac-arm64 para macOS em Apple Silicon.
- 3Escolha seu caminho de GPU: o build principal inclui suporte a CUDA da NVIDIA; para AMD, o projeto recomenda testar primeiro a opção Vulkan no build nocuda; existe um build ROCm contínuo separado para Linux; hardware antigo sem conjuntos de instruções modernos deve usar o build oldpc (CUDA11 + AVX1).
- 4Baixe um arquivo de modelo GGUF (por exemplo, do Hugging Face) se ainda não tiver um.
- 5Execute o binário, selecione o arquivo GGUF e uma quantidade de offload de camadas para a GPU na janela do launcher, e inicie o servidor.
- 6Uma aba do navegador abre automaticamente na interface KoboldAI Lite, já conectada ao servidor local em execução.
O KoboldCpp exige instalação?
Não. É um executável único — baixe e rode diretamente. Não há instalador, ambiente Python separado, nem contêiner Docker envolvido.
O KoboldCpp pode rodar sem GPU?
Sim. O funcionamento só com CPU é totalmente suportado; uma GPU (via CUDA, Vulkan ou ROCm) apenas acelera a velocidade de geração, nunca é obrigatória.
Quais GPUs e hardware o KoboldCpp suporta?
O KoboldCpp suporta configurações NVIDIA, AMD e só CPU por meio de variantes de build separadas, em vez de um binário universal único que detecta tudo automaticamente. Escolher o build correspondente ao seu hardware é necessário para que a aceleração por GPU funcione.
- NVIDIA — a aceleração CUDA já vem embutida nos binários da versão principal
- AMD — o próprio projeto recomenda testar primeiro o backend Vulkan no build nocuda, por ter a compatibilidade mais ampla; um binário ROCm contínuo separado também é mantido para Linux
- Multiplataforma — o backend Vulkan também roda em placas de vídeo Intel e placas NVIDIA/AMD mais antigas sem drivers específicos do fabricante
- Hardware antigo — o build oldpc é voltado para CUDA 11 e CPUs só com AVX1, para máquinas que não conseguem rodar o build padrão moderno
- Só CPU — o build nocuda roda sem nenhuma GPU, com velocidade reduzida em relação à inferência acelerada por GPU
Para quem é o KoboldCpp?
Use o KoboldCpp se escrita de histórias, roleplay ou um único arquivo sem instalação importam mais do que throughput bruto ou o menor footprint possível; use outra coisa se precisar de serviço em produção multiusuário ou do menor download possível.
Como o KoboldCpp se compara ao Ollama e a outras ferramentas locais?
As comparações mais próximas do KoboldCpp são outras ferramentas construídas sobre o llama.cpp, além dos motores de produção voltados a um trabalho totalmente diferente.
Ferramenta | Licença | Melhor para |
|---|---|---|
| KoboldCpp | AGPL 3.0 | Sem instalação, UI de roleplay/escrita embutida |
| llama.cpp | MIT | Maior suporte de hardware, controle direto |
| Ollama | MIT | CLI/API simples, gerenciamento de modelos |
| LM Studio | Proprietária (grátis) | GUI de desktop sem terminal |
| vLLM | Apache 2.0 | Serviço multiusuário de alto throughput |
| text-generation-webui | AGPL 3.0 | Personalização profunda de UI, muitos backends |
Erros comuns ao avaliar o KoboldCpp
A maior parte da confusão vem de tratar o KoboldCpp como um app instalado convencional, ou de baixá-lo de uma fonte não oficial.
Perguntas frequentes
O que é o KoboldCpp?
O KoboldCpp é uma aplicação de LLM local gratuita, em um único arquivo, construída sobre o llama.cpp. Ele executa modelos GGUF sem etapa de instalação e traz a interface web KoboldAI Lite, feita para escrita de histórias e roleplay.
Quem mantém o KoboldCpp?
O KoboldCpp é mantido por um desenvolvedor pseudônimo conhecido como LostRuins, no repositório github.com/LostRuins/koboldcpp. As versões saem com frequência; a v1.120 estava vigente no final de agosto de 2026.
O KoboldCpp é gratuito?
Sim. O KoboldCpp é gratuito e de código aberto sob licença AGPL 3.0. Não existe nível pago nem produto hospedado — todo deploy do KoboldCpp roda em hardware que você controla.
Sob qual licença o KoboldCpp é publicado?
AGPL 3.0 (GNU Affero General Public License versão 3), uma licença copyleft. Isso difere da licença MIT usada pelo llama.cpp, o motor sobre o qual o KoboldCpp é construído.
O KoboldCpp exige instalação?
Não. Ele é distribuído como um executável único por plataforma (Windows, Linux, macOS ARM64) — baixe e rode diretamente, sem instalador, ambiente Python ou contêiner Docker.
O KoboldCpp suporta GPUs AMD?
Sim, mas não pelo build CUDA principal. O projeto recomenda a opção Vulkan dentro do build nocuda como primeiro caminho para AMD, junto com um build ROCm contínuo mantido separadamente para Linux.
O que é o KoboldAI Lite?
O KoboldAI Lite é a interface web embutida no executável do KoboldCpp. Ela abre automaticamente no navegador assim que o servidor inicia, com saída editável, campos de memória/world-info e modos dedicados de chat, story e adventure para roleplay e escrita colaborativa.
O KoboldCpp consegue gerar imagens ou transcrever voz?
Sim. O mesmo executável embute geração de imagens com Stable Diffusion e transcrição de voz com Whisper, além da sua função principal de geração de texto.
O KoboldCpp serve para produção ou uso multiusuário?
Não, esse não é o objetivo de design dele. O KoboldCpp é construído para uso local de um único usuário com uma interface de escrita rica; para serviço de produção multiusuário de alta concorrência, vLLM ou NVIDIA TensorRT-LLM são as ferramentas adequadas.
Qual a diferença entre o KoboldCpp e o Ollama?
Ambos rodam sobre o llama.cpp, mas o Ollama aposta em uma CLI mínima e um registro de modelos sem interface embutida, enquanto o KoboldCpp traz uma interface completa de escrita e roleplay no navegador (KoboldAI Lite) dentro do mesmo executável único.
