Skip to main content
PromptQuorum
Início/LLMs locais avançados/KoboldCpp 2026: um arquivo só, sem instalação, feito para roleplay
Overview & Reference

KoboldCpp 2026: um arquivo só, sem instalação, feito para roleplay

·8 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

KoboldCpp é uma aplicação de LLM local gratuita, em um único arquivo, construída sobre o llama.cpp, que roda modelos GGUF sem etapa de instalação e já vem com a interface web KoboldAI Lite — um editor voltado para escrita de histórias e roleplay, não apenas um chat simples. Tem licença AGPL 3.0, é mantido por um desenvolvedor pseudônimo conhecido como LostRuins, e suporta aceleração por GPU via CUDA, Vulkan e ROCm, além de funcionar só com CPU.

O KoboldCpp é um único executável que roda modelos GGUF sem instalador, sem ambiente Python e sem Docker — e já vem com um editor voltado para escrita de histórias e roleplay, em vez de uma simples caixa de chat.

KoboldCpp 2026: um arquivo só, sem instalação, feito para roleplay

Principais conclusões

  • Licença AGPL 3.0 — uso gratuito, com obrigação de copyleft se modificado e redistribuído como serviço de rede
  • Construído sobre o llama.cpp (licença MIT) por baixo, com interface própria e funções adicionadas em cima
  • Um executável por plataforma: Windows, Linux x64, macOS ARM64 — sem instalador
  • O KoboldAI Lite, a interface web embutida, é feito para escrita de histórias e roleplay: saída editável, campos de memória/world-info e vários modos de chat/aventura
  • Aceleração por GPU via CUDA (NVIDIA) ou Vulkan (multiplataforma, caminho recomendado para AMD); existe um build ROCm contínuo para Linux; o funcionamento só com CPU também é totalmente suportado
  • Também inclui geração de imagens com Stable Diffusion e transcrição de voz com Whisper no mesmo executável

📍 Em uma frase

O KoboldCpp é uma aplicação de LLM local gratuita, com licença AGPL 3.0, em um único arquivo, construída sobre o llama.cpp, que roda modelos GGUF sem instalação e traz a interface web KoboldAI Lite para escrita de histórias e roleplay.

💬 Em termos simples

Baixe um arquivo, dê dois cliques, e uma aba do navegador abre com chat e edição de histórias já integrados — sem instalador separado, sem configuração de linha de comando, sem precisar de outro app por cima.

📌Nota: A única fonte oficial de download é a página de GitHub Releases. Um arquivo com o mesmo nome hospedado em outro site não pode ser verificado como o build genuíno.

O que é o KoboldCpp?

O KoboldCpp é um programa gratuito de arquivo único que roda modelos de linguagem em formato GGUF localmente, construído sobre o motor de inferência llama.cpp e mantido por um desenvolvedor pseudônimo conhecido como LostRuins. Ele herda as convenções de interface do projeto KoboldAI original, adaptadas para rodar sobre o backend do llama.cpp em vez de uma stack de inferência baseada em Python.

O projeto está hospedado em github.com/LostRuins/koboldcpp e é publicado sob a GNU Affero General Public License versão 3 (AGPL 3.0) — uma licença copyleft, diferente da licença MIT permissiva que o próprio llama.cpp usa por baixo. As versões saem com frequência; a vigente no momento do teste (final de agosto de 2026) era a v1.120.

  • Distribuído como um executável por plataforma — koboldcpp.exe (Windows), koboldcpp-linux-x64 (Linux), koboldcpp-mac-arm64 (macOS Apple Silicon)
  • Não exige instalador, ambiente Python nem Docker para rodar
  • Usa o llama.cpp para a inferência do modelo em si, e adiciona por cima seu próprio servidor, interface web e camada de API
  • Oferece um build nocuda (sem CUDA, compatível com Vulkan) e um build oldpc (CUDA11 + AVX1) para hardware antigo, além do build principal com CUDA

O que é o KoboldAI Lite, e o que ele acrescenta?

O KoboldAI Lite é a interface web embutida diretamente no executável do KoboldCpp — ela abre automaticamente em uma aba do navegador assim que o servidor inicia, sem etapa de instalação separada. É construída especificamente para escrita longa e roleplay, não apenas chat em turnos.

  • Saída editável: o texto gerado pode ser editado diretamente, não só regenerado — importante para escrita colaborativa de histórias
  • Campos Memory e World Info: blocos de contexto persistentes que o modelo sempre vê, usados para manter detalhes de personagens ou fatos da história consistentes ao longo de uma sessão longa
  • Vários modos: chat padrão, um modo "Story" para ficção colaborativa e um modo "Adventure" no estilo de jogos de aventura em texto
  • Controles de Author's Note e formatação instruct para direcionar tom e estilo sem editar manualmente o template de prompt subjacente
  • Roda inteiramente a partir do mesmo executável e do mesmo servidor local — sem precisar de um app frontend ou extensão de navegador separados

Como baixar e rodar o KoboldCpp?

Baixe o arquivo correto para sua plataforma na página oficial de GitHub Releases e rode diretamente — não existe etapa de instalação. Escolher o build certo para o seu hardware é a única decisão real envolvida.

  1. 1
    Acesse a página de Releases do KoboldCpp no GitHub — a única fonte de download oficial.
  2. 2
    Escolha o build da sua plataforma: koboldcpp.exe para Windows, koboldcpp-linux-x64 para Linux, ou koboldcpp-mac-arm64 para macOS em Apple Silicon.
  3. 3
    Escolha seu caminho de GPU: o build principal inclui suporte a CUDA da NVIDIA; para AMD, o projeto recomenda testar primeiro a opção Vulkan no build nocuda; existe um build ROCm contínuo separado para Linux; hardware antigo sem conjuntos de instruções modernos deve usar o build oldpc (CUDA11 + AVX1).
  4. 4
    Baixe um arquivo de modelo GGUF (por exemplo, do Hugging Face) se ainda não tiver um.
  5. 5
    Execute o binário, selecione o arquivo GGUF e uma quantidade de offload de camadas para a GPU na janela do launcher, e inicie o servidor.
  6. 6
    Uma aba do navegador abre automaticamente na interface KoboldAI Lite, já conectada ao servidor local em execução.

O KoboldCpp exige instalação?

Não. É um executável único — baixe e rode diretamente. Não há instalador, ambiente Python separado, nem contêiner Docker envolvido.

O KoboldCpp pode rodar sem GPU?

Sim. O funcionamento só com CPU é totalmente suportado; uma GPU (via CUDA, Vulkan ou ROCm) apenas acelera a velocidade de geração, nunca é obrigatória.

Quais GPUs e hardware o KoboldCpp suporta?

O KoboldCpp suporta configurações NVIDIA, AMD e só CPU por meio de variantes de build separadas, em vez de um binário universal único que detecta tudo automaticamente. Escolher o build correspondente ao seu hardware é necessário para que a aceleração por GPU funcione.

  • NVIDIA — a aceleração CUDA já vem embutida nos binários da versão principal
  • AMD — o próprio projeto recomenda testar primeiro o backend Vulkan no build nocuda, por ter a compatibilidade mais ampla; um binário ROCm contínuo separado também é mantido para Linux
  • Multiplataforma — o backend Vulkan também roda em placas de vídeo Intel e placas NVIDIA/AMD mais antigas sem drivers específicos do fabricante
  • Hardware antigo — o build oldpc é voltado para CUDA 11 e CPUs só com AVX1, para máquinas que não conseguem rodar o build padrão moderno
  • Só CPU — o build nocuda roda sem nenhuma GPU, com velocidade reduzida em relação à inferência acelerada por GPU

Para quem é o KoboldCpp?

Use o KoboldCpp se escrita de histórias, roleplay ou um único arquivo sem instalação importam mais do que throughput bruto ou o menor footprint possível; use outra coisa se precisar de serviço em produção multiusuário ou do menor download possível.

Como o KoboldCpp se compara ao Ollama e a outras ferramentas locais?

As comparações mais próximas do KoboldCpp são outras ferramentas construídas sobre o llama.cpp, além dos motores de produção voltados a um trabalho totalmente diferente.

Ferramenta
Licença
Melhor para
KoboldCppAGPL 3.0Sem instalação, UI de roleplay/escrita embutida
llama.cppMITMaior suporte de hardware, controle direto
OllamaMITCLI/API simples, gerenciamento de modelos
LM StudioProprietária (grátis)GUI de desktop sem terminal
vLLMApache 2.0Serviço multiusuário de alto throughput
text-generation-webuiAGPL 3.0Personalização profunda de UI, muitos backends

Erros comuns ao avaliar o KoboldCpp

A maior parte da confusão vem de tratar o KoboldCpp como um app instalado convencional, ou de baixá-lo de uma fonte não oficial.

Perguntas frequentes

O que é o KoboldCpp?

O KoboldCpp é uma aplicação de LLM local gratuita, em um único arquivo, construída sobre o llama.cpp. Ele executa modelos GGUF sem etapa de instalação e traz a interface web KoboldAI Lite, feita para escrita de histórias e roleplay.

Quem mantém o KoboldCpp?

O KoboldCpp é mantido por um desenvolvedor pseudônimo conhecido como LostRuins, no repositório github.com/LostRuins/koboldcpp. As versões saem com frequência; a v1.120 estava vigente no final de agosto de 2026.

O KoboldCpp é gratuito?

Sim. O KoboldCpp é gratuito e de código aberto sob licença AGPL 3.0. Não existe nível pago nem produto hospedado — todo deploy do KoboldCpp roda em hardware que você controla.

Sob qual licença o KoboldCpp é publicado?

AGPL 3.0 (GNU Affero General Public License versão 3), uma licença copyleft. Isso difere da licença MIT usada pelo llama.cpp, o motor sobre o qual o KoboldCpp é construído.

O KoboldCpp exige instalação?

Não. Ele é distribuído como um executável único por plataforma (Windows, Linux, macOS ARM64) — baixe e rode diretamente, sem instalador, ambiente Python ou contêiner Docker.

O KoboldCpp suporta GPUs AMD?

Sim, mas não pelo build CUDA principal. O projeto recomenda a opção Vulkan dentro do build nocuda como primeiro caminho para AMD, junto com um build ROCm contínuo mantido separadamente para Linux.

O que é o KoboldAI Lite?

O KoboldAI Lite é a interface web embutida no executável do KoboldCpp. Ela abre automaticamente no navegador assim que o servidor inicia, com saída editável, campos de memória/world-info e modos dedicados de chat, story e adventure para roleplay e escrita colaborativa.

O KoboldCpp consegue gerar imagens ou transcrever voz?

Sim. O mesmo executável embute geração de imagens com Stable Diffusion e transcrição de voz com Whisper, além da sua função principal de geração de texto.

O KoboldCpp serve para produção ou uso multiusuário?

Não, esse não é o objetivo de design dele. O KoboldCpp é construído para uso local de um único usuário com uma interface de escrita rica; para serviço de produção multiusuário de alta concorrência, vLLM ou NVIDIA TensorRT-LLM são as ferramentas adequadas.

Qual a diferença entre o KoboldCpp e o Ollama?

Ambos rodam sobre o llama.cpp, mas o Ollama aposta em uma CLI mínima e um registro de modelos sem interface embutida, enquanto o KoboldCpp traz uma interface completa de escrita e roleplay no navegador (KoboldAI Lite) dentro do mesmo executável único.

Fontes

← Voltar para LLMs locais avançados