Skip to main content
PromptQuorum
Início/LLMs locais/text-generation-webui em 2026: Como a Interface de LLM Local do Oobabooga Virou "TextGen"
Tools & Interfaces

text-generation-webui em 2026: Como a Interface de LLM Local do Oobabooga Virou "TextGen"

·11 min de leitura·By Hans Kuepper · Founder of PromptQuorum, multi-model AI dispatch tool · PromptQuorum

Use o text-generation-webui (TextGen) se você quer a interface de LLM local gratuita mais configurável, com treinamento LoRA, múltiplos motores de backend e uma API com tool-calling em um único app. Não é para: quem quer o app de chat gratuito mais simples e pronto para uso (use o LM Studio em vez disso); uma equipe que precisa de contas multiusuário integradas (não existe isso aqui — use o Open WebUI); uma experiência voltada para roleplay, com character cards e lorebooks (use o SillyTavern como frontend, com este aqui como backend).

text-generation-webui é a interface de LLM local para power users: gratuita, de código aberto (AGPL 3.0) e construída por um único mantenedor conhecido como "oobabooga" desde dezembro de 2022. Em abril de 2026 o projeto se renomeou para "TextGen" e lançou um aplicativo desktop nativo, mas o projeto no GitHub que todo mundo ainda procura como "text-generation-webui" é a mesma base de código com 47.000+ estrelas.

Key Takeaways

  • text-generation-webui (github.com/oobabooga/textgen) é gratuito e de código aberto sob AGPL 3.0, com mais de 47.600 estrelas no GitHub.
  • Foi criado pelo desenvolvedor "oobabooga" em dezembro de 2022, inspirado no Stable Diffusion WebUI do AUTOMATIC1111.
  • Em abril de 2026 (versão 4.5.2) o projeto se renomeou para "TextGen" e migrou para um novo repositório; o nome e a URL antigos ainda redirecionam para lá.
  • Os backends suportados hoje são llama.cpp, ik_llama.cpp, Transformers, ExLlamaV3 e TensorRT-LLM — loaders mais antigos como AutoGPTQ e ExLlamaV2 foram descontinuados.
  • Uma atualização de maio de 2026 adicionou um aplicativo desktop nativo em Electron, fechando boa parte da diferença de complexidade de configuração em relação a ferramentas prontas para uso como o LM Studio.

text-generation-webui é uma interface de LLM local gratuita e de código aberto (AGPL 3.0), criada pelo desenvolvedor "oobabooga" em dezembro de 2022, que executa modelos diretamente por meio de llama.cpp, ExLlamaV3, Transformers ou TensorRT-LLM, e que em abril de 2026 se renomeou para "TextGen" enquanto lançava um aplicativo desktop nativo.

Diferente do Open WebUI, o text-generation-webui não apenas conversa com um servidor de modelo — ele É o motor que carrega e executa o modelo na sua máquina, com uma quantidade enorme de ajustes para controlar exatamente como o texto é gerado.

Fatos Rápidos: text-generation-webui (TextGen)

  • Licença: AGPL 3.0 (totalmente de código aberto)
  • Plataformas: Windows, Linux, macOS (builds portáteis em Electron ou instalação completa em Python/Conda)
  • Site / GitHub: github.com/oobabooga/textgen (anteriormente github.com/oobabooga/text-generation-webui)
  • Estatísticas: 47.600+ estrelas, ~6.000 forks, ~380-395 contribuidores
  • Custo: Gratuito, sem empresa por trás, sem plano pago
  • Função principal: Executa modelos locais diretamente (llama.cpp, ExLlamaV3, Transformers, TensorRT-LLM) com uma interface de chat configurável, treinamento LoRA e uma API com tool-calling

O Que É o text-generation-webui?

text-generation-webui é uma aplicação gratuita e de código aberto que carrega e executa um modelo de linguagem local E fornece a interface de chat para ele — diferente de ferramentas que apenas ficam na frente de um servidor, como o Open WebUI, ele é o próprio motor de inferência, não apenas um cliente. Ele suporta vários motores de backend diferentes para que você escolha o formato em que seu modelo é distribuído: GGUF via llama.cpp, EXL3 via ExLlamaV3, precisão total via Transformers, ou inferência otimizada via TensorRT-LLM.

Ele é distribuído tanto como um build desktop portátil (descompacte e dê duplo clique, com uma janela nativa opcional em Electron) quanto como uma instalação Python completa para usuários que também querem fine-tuning com LoRA e geração de imagens, que exigem um conjunto maior de dependências.

Sua característica marcante desde 2022 tem sido a profundidade de controle: parâmetros de amostragem, templates de prompt, extensões e uma API compatível com OpenAI/Anthropic com tool-calling vêm todos integrados, ao custo de uma curva de aprendizado mais acentuada do que apps de consumo com propósito único.

Histórico: Do Projeto Paralelo do oobabooga ao "TextGen"

O repositório foi criado em 21 de dezembro de 2022, por um desenvolvedor conhecido apenas pelo seu apelido no GitHub, "oobabooga." O nome real dessa pessoa não foi divulgado publicamente em nenhuma fonte que conseguimos verificar — apesar da relevância do projeto, o mantenedor manteve sua identidade privada o tempo todo. A própria documentação do projeto o descreve como construído no espírito do, e usando o mesmo framework Gradio do, Stable Diffusion WebUI do AUTOMATIC1111 — a ferramenta equivalente para geração de imagens que é anterior a ele.

Em agosto de 2023, o mantenedor recebeu uma doação de código aberto da empresa de capital de risco Andreessen Horowitz (a16z) para apoiar o desenvolvimento independente e em tempo integral — um dos primeiros exemplos de uma empresa de VC financiando diretamente um mantenedor individual de código aberto, em vez de uma empresa. (Não conseguimos confirmar de forma independente o valor exato da doação a partir de uma fonte primária da a16z; trate esse detalhe como não confirmado.)

A maior mudança do projeto chegou em 2026, não como um ajuste de interface, mas como um rebranding completo: a versão 4.5.2, lançada em 15 de abril de 2026, renomeou o projeto de "text-generation-webui" para "TextGen" e moveu o repositório do GitHub para `github.com/oobabooga/textgen` (a URL antiga redireciona automaticamente). Uma sequência rápida de lançamentos se seguiu: 4.6.2 (23 de abril) adicionou confirmação de tool-call e suporte a servidor MCP via stdio; 4.7.3 (3 de maio) lançou um aplicativo desktop nativo em Electron — a maior mudança de usabilidade da história do projeto, transformando uma ferramenta de aba de navegador em uma aplicação real de duplo clique — além de builds DGX Spark aarch64 e paralelismo de tensores no llama.cpp; 4.8 (7 de maio) redesenhou o compositor de chat; e 4.9 (20 de maio) adicionou decodificação especulativa MTP e um indicador ao vivo de tokens por segundo.

Junto com o rebranding, a lista de backends suportados mudou substancialmente: AutoGPTQ, AutoAWQ e os loaders originais ExLlama/ExLlamaV2 não fazem mais parte do README atual, substituídos por llama.cpp, ik_llama.cpp, Transformers, ExLlamaV3 e TensorRT-LLM como a lista atual.

O Que Você Pode Realmente Fazer Com o text-generation-webui?

  • Execute um modelo com o backend que combina com seu hardware. Escolha llama.cpp para modelos quantizados em GGUF, ExLlamaV3 para quantização EXL3 em GPUs NVIDIA, Transformers para precisão total, ou TensorRT-LLM para inferência NVIDIA otimizada — tudo pela mesma interface.
  • Faça fine-tuning de um modelo com LoRA. A aba Training suporta fine-tuning com LoRA em datasets formatados como chat ou em texto bruto, com treinamentos que podem ser pausados e retomados — um recurso que a maioria dos apps de chat prontos para uso simplesmente não oferece.
  • Automatize através de uma API com tool-calling. Um servidor de API compatível com OpenAI e com Anthropic suporta funções Python personalizadas e servidores MCP (Model Context Protocol), para que scripts externos e agentes possam chamar ferramentas através do mesmo modelo com que você está conversando.
  • Alterne modos de chat conforme a tarefa. Modo Instruct para perguntas e respostas diretas, modo Chat para conversas baseadas em persona, Chat-Instruct como um híbrido, e modo Notebook para completar texto livre fora de um formato de conversa.
  • Anexe imagens e documentos. Modelos com capacidade de visão podem processar imagens anexadas, e arquivos PDF/DOCX podem ser enviados diretamente em uma conversa.
  • Gere imagens no mesmo app. Uma aba integrada de geração de imagens suporta modelos de imagem baseados em diffusers (como o Z-Image-Turbo) junto com seu modelo de texto.

Quem Deveria Usar o text-generation-webui?

O text-generation-webui é feito para pessoas que querem ver e controlar cada configuração que afeta como um modelo local gera texto — não para quem quer um app que tome todas as decisões por elas.

  • Você quer fazer fine-tuning de um modelo com LoRA sem um pipeline de treinamento separado → a aba Training integrada resolve isso diretamente.
  • Você quer poder escolher o motor de backend por modelo → llama.cpp, ExLlamaV3, Transformers e TensorRT-LLM estão todos disponíveis em um único app.
  • Você quer construir agentes ou scripts em cima de uma API local com tool-calling → a API compatível com OpenAI/Anthropic com suporte a MCP cobre isso sem precisar de uma ponte de terceiros.
  • Você quer um app desktop de verdade agora, não apenas uma aba de navegador → a reconstrução em Electron de 2026 oferece uma experiência de lançamento com duplo clique.
  • Você quer a experiência de chat de um clique mais simples possível, sem configurações para entender → experimente o LM Studio em vez disso.
  • Você precisa de character cards, lorebooks e ferramentas específicas para roleplay → combine o SillyTavern como frontend com o text-generation-webui como um possível backend.
  • Se estiver em dúvida: baixe o build portátil para seu sistema operacional e GPU, dê duplo clique nele e carregue primeiro um modelo GGUF pequeno via llama.cpp — você pode explorar o treinamento LoRA e a API depois.

Quando Você NÃO Deveria Usar o text-generation-webui?

A profundidade de controle é todo o sentido de existir do text-generation-webui, e é exatamente isso que faz dele uma escolha ruim em algumas situações.

  • Se você quer configuração zero: mesmo com o app em Electron de 2026, existem mais configurações (parâmetros de amostragem, escolha de backend, templates de prompt) do que um app de chat de consumo com propósito único expõe.
  • Se você precisa de contas multiusuário integradas ou controles de acesso para equipe: não há sistema de login nem acesso baseado em papéis — é uma aplicação local de usuário único. Use o Open WebUI se precisar disso.
  • Se roleplay com character cards e lorebooks é o seu principal caso de uso: o text-generation-webui não tem ferramentas dedicadas de roleplay; combine-o com o SillyTavern como frontend em vez disso.
  • Se você precisa de um contrato de suporte garantido: é um projeto comunitário mantido por um único desenvolvedor, sem plano de suporte comercial nem SLA.
  • Se você só quer usar modelos na nuvem: ele é construído em torno da execução de modelos localmente no seu próprio hardware; não é um cliente para gerenciar chaves de API de provedores de nuvem como ferramentas do tipo LibreChat.

Como Você Instala o text-generation-webui?

Existem dois caminhos de instalação suportados, dependendo se você precisa de treinamento e geração de imagens:

  • 1. Build portátil (recomendado para a maioria dos usuários). Baixe o arquivo compatível com seu sistema operacional e GPU em github.com/oobabooga/textgen/releases — existem builds separados para CUDA, Vulkan, ROCm e apenas CPU. Descompacte e dê duplo clique no executável `textgen`; uma janela nativa em Electron abre por padrão (passe `--no-electron` para a interface clássica em aba de navegador em `http://127.0.0.1:7860`).
  • 2. Instalação completa (necessária para treinamento LoRA e geração de imagens). Clone o repositório e execute `start_windows.bat`, `start_linux.sh` ou `start_macos.sh`, que configura um ambiente Conda e instala as dependências automaticamente (cerca de 10 GB de espaço em disco).
  • 3. Docker. Dockerfiles separados são fornecidos por fabricante (NVIDIA, AMD, Intel, CPU); execute `docker compose up --build` a partir do diretório correspondente.
  • 4. Baixe um modelo. Use a aba Model integrada para puxar um modelo diretamente do Hugging Face, ou coloque manualmente um arquivo GGUF na pasta `models/`, e depois selecione o backend correspondente.
  • 5. Escolha um modo de chat. Escolha o modo Instruct, Chat, Chat-Instruct ou Notebook na aba Parameters, dependendo do seu caso de uso.
  • A documentação completa é mantida na wiki do projeto.

Preços: Gratuito e de Código Aberto

Não existe um plano de preços para comparar — o text-generation-webui sempre foi totalmente gratuito.

  • Gratuito, para sempre, para todo mundo. O software é licenciado sob AGPL 3.0, sem versão paga, sem assinatura e sem nenhuma empresa vendendo-o.
  • Sem versão hospedada. Ele foi projetado para rodar no seu próprio hardware; não existe uma oferta oficial de "TextGen como serviço" hospedada na nuvem.
  • Histórico de financiamento. O mantenedor recebeu uma doação única da Andreessen Horowitz para código aberto em 2023, para apoiar o desenvolvimento em tempo integral — isso financiou o tempo do desenvolvedor, não um produto comercial, e não mudou a licença nem introduziu um plano pago.
  • Seu único custo real é o hardware. Como ele executa modelos localmente, o custo prático é apenas a GPU ou CPU que você já possui — não há nenhuma cobrança por token ou por mensagem vinda do próprio software.

text-generation-webui vs KoboldCpp vs LM Studio vs Open WebUI: Qual Escolher?

Essas quatro ferramentas resolvem problemas sobrepostos, mas distintos — três executam modelos diretamente, uma é um frontend para um backend separado.

Ferramenta
Link
Melhor para
Executa modelos diretamente
Treinamento LoRA
Múltiplos usuários
Licença
text-generation-webui (TextGen)github.com/oobabooga/textgenConfigurabilidade profunda: múltiplos backends, treinamento LoRA, API com tool-callingSim (llama.cpp, ExLlamaV3, Transformers, TensorRT-LLM)SimNãoAGPL 3.0
KoboldCppgithub.com/LostRuins/koboldcppBackend leve, amigável para escrita criativa/roleplay, fácil integração com SillyTavernSim (baseado em llama.cpp)NãoNãoAGPL 3.0
LM Studiolmstudio.aiGUI pronta para uso mais simples para baixar e executar modelos GGUFSim (nativo)NãoNãoGratuito (código fechado)
Open WebUIopenwebui.comFrontend multiusuário auto-hospedado para um backend executado separadamenteNão (precisa de Ollama/vLLM/API)NãoSim, com papéisOpen WebUI License

Para um chat focado em personagens/roleplay que pode usar o text-generation-webui como backend, veja o SillyTavern. Para uma comparação mais ampla entre backend e motor de servidor, veja text-generation-webui vs vLLM vs llama.cpp.

Erros Comuns Com o text-generation-webui

  • Carregar um arquivo GGUF com o backend errado selecionado. Combine o backend com o formato do modelo: llama.cpp para GGUF, ExLlamaV3 para EXL3, Transformers para safetensors de precisão total.
  • Procurar "text-generation-webui" no GitHub e assumir que foi abandonado porque o principal resultado agora é "TextGen". É o mesmo projeto, ativamente mantido, sob um novo nome e uma nova URL de repositório desde abril de 2026 — a URL antiga simplesmente redireciona.
  • Usar um guia desatualizado que faz referência ao AutoGPTQ ou ao ExLlama original. Esses loaders não fazem mais parte da lista atual de backends; use llama.cpp ou ExLlamaV3 em vez disso.
  • Esperar login multiusuário integrado. Não existe sistema de contas — se várias pessoas precisam de acesso separado, isso exige uma ferramenta diferente, como o Open WebUI na frente de um backend compartilhado.
  • Tentar usá-lo como frontend de roleplay com character cards. Ele não tem sistema de lorebook ou character card; combine-o com o SillyTavern para esse fluxo de trabalho em vez disso.

Perguntas Frequentes Sobre o text-generation-webui

O text-generation-webui é a mesma coisa que o TextGen?

Sim. Na versão 4.5.2 (15 de abril de 2026) o projeto se renomeou de "text-generation-webui" para "TextGen" e moveu seu repositório no GitHub para github.com/oobabooga/textgen. Ele é mantido pelo mesmo desenvolvedor e mantém a mesma contagem de estrelas e o mesmo histórico de commits; a URL antiga do repositório redireciona para a nova.

Quem criou o text-generation-webui?

Um desenvolvedor conhecido pelo apelido "oobabooga" criou o projeto, com o primeiro commit datado de 21 de dezembro de 2022. O nome real dessa pessoa nunca foi divulgado publicamente em nenhuma fonte que conseguimos verificar.

O text-generation-webui é gratuito?

Sim, totalmente. Ele é licenciado sob AGPL 3.0, não tem empresa por trás e não tem nenhum plano pago. O mantenedor recebeu uma doação única da Andreessen Horowitz para código aberto em 2023, para apoiar o desenvolvimento em tempo integral, mas isso não criou um produto comercial.

Quais backends o text-generation-webui suporta?

Em 2026, os backends suportados são llama.cpp, ik_llama.cpp, Transformers, ExLlamaV3 e TensorRT-LLM. Backends mais antigos de versões anteriores — AutoGPTQ, AutoAWQ e o ExLlama/ExLlamaV2 original — não constam mais como suportados na base de código atual.

O text-generation-webui suporta fine-tuning com LoRA?

Sim. A aba Training suporta fine-tuning com LoRA tanto em datasets de chat multi-turno quanto em texto bruto, e os treinamentos podem ser pausados e retomados.

O text-generation-webui tem uma API?

Sim. Ele expõe uma API compatível com OpenAI e outra compatível com Anthropic (cobrindo endpoints no estilo Chat, Completions e Messages), com suporte a tool-calling por meio de funções Python personalizadas ou servidores MCP, além de autenticação opcional via --api-key/--admin-key.

O text-generation-webui é bom para roleplay?

Ele pode ser usado para roleplay graças aos seus controles detalhados de parâmetros de amostragem, mas não é um software feito primariamente para roleplay — não tem character cards, lorebooks ou chat em grupo. Para um frontend voltado especificamente a roleplay, veja o SillyTavern, que pode usar o text-generation-webui como um de seus backends.

O text-generation-webui precisa de navegador agora?

Não necessariamente. Desde a versão 4.7.3 (maio de 2026), os builds portáteis abrem por padrão como uma janela desktop nativa em Electron. Passe a flag --no-electron se preferir a interface clássica em aba de navegador, em http://127.0.0.1:7860.

Qual a diferença entre o text-generation-webui e o KoboldCpp?

O KoboldCpp é feito especificamente para escrita criativa e roleplay, e é comumente usado como um backend leve e simples para o SillyTavern. O text-generation-webui é mais amplo e configurável, com mais motores de backend, treinamento LoRA e uma API mais completa, ao custo de mais configurações para entender.

Qual a diferença entre o text-generation-webui e o Open WebUI?

O Open WebUI é um frontend baseado em servidor, multiusuário, que costuma ficar na frente do Ollama ou de outro backend. O text-generation-webui é um app desktop/local de usuário único que é ele mesmo o host do motor de inferência — ele executa o modelo diretamente em vez de se conectar a um modelo gerenciado separadamente.

Fontes

Nota sobre informações de terceiros

Este artigo faz referência a modelos de IA, benchmarks, preços e licenças de terceiros. O cenário da IA muda rapidamente. Pontuações de benchmark, termos de licença, nomes de modelos e preços de API podem mudar entre o momento em que foi escrito e quando você está lendo. Antes de tomar decisões de implantação ou conformidade com base neste artigo, verifique os dados atuais na fonte oficial de cada fornecedor: fichas de modelos do Hugging Face para licenças e benchmarks, sites dos fornecedores para preços de API e EUR-Lex para o texto atual do GDPR e da Lei de IA da UE.

Run PromptQuorum with a local LLM, your own API keys, or both — you pick the backend.

Download the PromptQuorum Beta →

← Back to Local LLMs