Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/KoboldCpp 2026 : un seul fichier, aucune installation, pensé pour le jeu de rôle
Overview & Reference

KoboldCpp 2026 : un seul fichier, aucune installation, pensé pour le jeu de rôle

·8 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

KoboldCpp est une application LLM locale gratuite, en un seul fichier, construite sur llama.cpp, qui fait tourner des modèles GGUF sans étape d'installation et embarque l'interface web KoboldAI Lite — un éditeur pensé pour l'écriture narrative et le jeu de rôle plutôt qu'une simple fenêtre de chat. Elle est publiée sous licence AGPL 3.0, maintenue par un développeur pseudonyme connu sous le nom de LostRuins, et prend en charge l'accélération GPU CUDA, Vulkan et ROCm ainsi que le fonctionnement CPU seul.

KoboldCpp est un exécutable unique qui fait tourner des modèles GGUF sans installateur, sans environnement Python et sans Docker — avec un éditeur d'écriture narrative et de jeu de rôle intégré, plutôt qu'une simple fenêtre de chat.

KoboldCpp 2026 : un seul fichier, aucune installation, pensé pour le jeu de rôle

Points clés

  • Licence AGPL 3.0 — utilisation gratuite, copyleft en cas de modification et de redistribution en tant que service réseau
  • Construit sur llama.cpp (licence MIT) en arrière-plan, avec sa propre interface et des fonctionnalités ajoutées par-dessus
  • Un exécutable par plateforme : Windows, Linux x64, macOS ARM64 — aucun installateur
  • KoboldAI Lite, l'interface web intégrée, est pensée pour l'écriture narrative et le jeu de rôle : sortie éditable, champs mémoire/world-info et plusieurs modes chat/aventure
  • Accélération GPU via CUDA (NVIDIA) ou Vulkan (multi-fournisseurs, voie recommandée pour AMD) ; un build ROCm évolutif existe pour Linux ; le fonctionnement CPU seul est aussi pleinement pris en charge
  • Intègre aussi la génération d'images Stable Diffusion et la transcription vocale Whisper dans le même exécutable

📍 En une phrase

KoboldCpp est une application LLM locale gratuite, sous licence AGPL 3.0, en un seul fichier, construite sur llama.cpp, qui fait tourner des modèles GGUF sans installation et embarque l'interface web KoboldAI Lite pour l'écriture narrative et le jeu de rôle.

💬 En termes simples

Téléchargez un fichier, double-cliquez dessus, et un onglet de navigateur s'ouvre avec une interface de chat et d'édition narrative déjà intégrée — pas d'installateur séparé, pas de configuration en ligne de commande, pas d'application supplémentaire à ajouter par-dessus.

📌Remarque: La seule source de téléchargement officielle est la page GitHub Releases. Un fichier portant le même nom hébergé ailleurs ne peut pas être vérifié comme le build authentique.

Qu'est-ce que KoboldCpp ?

KoboldCpp est un programme gratuit en un seul fichier qui fait tourner localement des modèles de langage au format GGUF, construit sur le moteur d'inférence llama.cpp et maintenu par un développeur pseudonyme connu sous le nom de LostRuins. Il hérite des conventions d'interface du projet KoboldAI original, adaptées pour fonctionner sur le backend de llama.cpp plutôt que sur une pile d'inférence Python.

Le projet est hébergé sur github.com/LostRuins/koboldcpp et publié sous licence GNU Affero General Public License version 3 (AGPL 3.0) — une licence copyleft, distincte de la licence MIT permissive utilisée par llama.cpp lui-même en arrière-plan. Les versions sortent fréquemment ; la version en vigueur au moment des tests (fin août 2026) était la v1.120.

  • Distribué comme un exécutable par plateforme — koboldcpp.exe (Windows), koboldcpp-linux-x64 (Linux), koboldcpp-mac-arm64 (macOS Apple Silicon)
  • Aucun installateur, aucun environnement Python et aucun Docker requis pour l'exécuter
  • S'appuie sur llama.cpp pour l'inférence de modèle proprement dite, puis ajoute son propre serveur, son interface web et sa couche API
  • Propose un build nocuda (sans CUDA, compatible Vulkan) et un build oldpc (CUDA11 + AVX1) pour le matériel ancien, en plus du build principal avec CUDA

Qu'est-ce que KoboldAI Lite, et qu'apporte-t-elle en plus ?

KoboldAI Lite est l'interface web intégrée directement dans l'exécutable KoboldCpp — elle s'ouvre automatiquement dans un onglet de navigateur dès que le serveur démarre, sans étape d'installation séparée. Elle est spécifiquement conçue pour l'écriture longue et le jeu de rôle, pas seulement pour un chat tour par tour.

  • Sortie éditable : le texte généré peut être modifié directement, pas seulement régénéré — important pour l'écriture collaborative
  • Champs Memory et World Info : blocs de contexte persistants toujours visibles par le modèle, utilisés pour garder les détails d'un personnage ou les faits d'une histoire cohérents sur une longue session
  • Plusieurs modes : chat standard, un mode « Story » pour la fiction collaborative, et un mode « Adventure » dans le style des jeux d'aventure textuels
  • Contrôles Author's Note et de formatage instruct pour orienter le ton et le style sans modifier à la main le modèle de prompt sous-jacent
  • Fonctionne entièrement depuis le même exécutable et le même serveur local — aucune application frontend ni extension de navigateur séparée nécessaire

Comment télécharger et lancer KoboldCpp ?

Téléchargez le fichier correspondant à votre plateforme depuis la page GitHub Releases officielle, puis exécutez-le directement — aucune étape d'installation. Choisir le bon build pour son matériel est la seule vraie décision à prendre.

  1. 1
    Rendez-vous sur la page Releases de KoboldCpp sur GitHub — l'unique source de téléchargement officielle.
  2. 2
    Choisissez le build de votre plateforme : koboldcpp.exe pour Windows, koboldcpp-linux-x64 pour Linux, ou koboldcpp-mac-arm64 pour macOS sur Apple Silicon.
  3. 3
    Choisissez votre voie GPU : le build principal inclut le support CUDA NVIDIA ; pour AMD, le projet recommande d'essayer d'abord l'option Vulkan du build nocuda ; un build ROCm évolutif existe séparément pour Linux ; le matériel ancien sans jeux d'instructions modernes doit utiliser le build oldpc (CUDA11 + AVX1).
  4. 4
    Téléchargez un fichier de modèle GGUF (par exemple depuis Hugging Face) si vous n'en avez pas déjà un.
  5. 5
    Lancez l'exécutable, sélectionnez le fichier GGUF et une quantité de déchargement de couches GPU dans la fenêtre de lancement, puis démarrez le serveur.
  6. 6
    Un onglet de navigateur s'ouvre automatiquement sur l'interface KoboldAI Lite, déjà connectée au serveur local en cours d'exécution.

KoboldCpp nécessite-t-il une installation ?

Non. C'est un exécutable unique — téléchargez-le et lancez-le directement. Aucun installateur, aucun environnement Python séparé, aucun conteneur Docker n'est impliqué.

KoboldCpp peut-il fonctionner sans GPU ?

Oui. Le fonctionnement CPU seul est pleinement pris en charge ; un GPU (via CUDA, Vulkan ou ROCm) accélère uniquement la vitesse de génération, il n'est jamais requis.

Quels GPU et matériels KoboldCpp prend-il en charge ?

KoboldCpp prend en charge les configurations NVIDIA, AMD et CPU seul via des variantes de build séparées, plutôt qu'un binaire universel détectant tout automatiquement. Choisir le build correspondant à son matériel est nécessaire pour obtenir l'accélération GPU.

  • NVIDIA — l'accélération CUDA est intégrée aux binaires de la version principale
  • AMD — le projet recommande lui-même d'essayer d'abord le backend Vulkan du build nocuda, qui offre la compatibilité la plus large ; un binaire ROCm évolutif séparé est également maintenu pour Linux
  • Multi-fournisseurs — le backend Vulkan fonctionne aussi sur les cartes graphiques Intel et les cartes NVIDIA/AMD plus anciennes sans pilotes spécifiques
  • Matériel ancien — le build oldpc cible CUDA 11 et les CPU AVX1 uniquement, pour les machines incapables d'exécuter le build standard moderne
  • CPU seul — le build nocuda fonctionne sans aucun GPU, à vitesse réduite par rapport à l'inférence accélérée par GPU

À qui s'adresse KoboldCpp ?

Utilisez KoboldCpp si l'écriture narrative, le jeu de rôle ou un fichier unique sans installation comptent plus que le débit brut ou l'empreinte minimale ; utilisez autre chose si vous avez besoin de service en production multi-utilisateurs ou du plus petit téléchargement possible.

Comment KoboldCpp se compare-t-il à Ollama et aux autres outils locaux ?

Les comparaisons les plus proches de KoboldCpp sont d'autres outils construits sur llama.cpp, ainsi que les moteurs de production pensés pour un tout autre usage.

Outil
Licence
Idéal pour
KoboldCppAGPL 3.0Sans installation, UI jeu de rôle/écriture intégrée
llama.cppMITSupport matériel le plus large, contrôle direct
OllamaMITCLI/API simple, gestion des modèles
LM StudioPropriétaire (gratuit)Interface de bureau sans terminal
vLLMApache 2.0Service multi-utilisateurs à fort débit
text-generation-webuiAGPL 3.0Personnalisation UI poussée, nombreux backends

Erreurs courantes lors de l'évaluation de KoboldCpp

La plupart des confusions viennent du fait de traiter KoboldCpp comme une application classique installée, ou de le télécharger depuis une source non officielle.

Questions fréquentes

Qu'est-ce que KoboldCpp ?

KoboldCpp est une application LLM locale gratuite, en un seul fichier, construite sur llama.cpp. Elle exécute des modèles GGUF sans étape d'installation et embarque l'interface web KoboldAI Lite, conçue pour l'écriture narrative et le jeu de rôle.

Qui maintient KoboldCpp ?

KoboldCpp est maintenu par un développeur pseudonyme connu sous le nom de LostRuins, sur le dépôt github.com/LostRuins/koboldcpp. Les versions sortent fréquemment, la v1.120 étant en vigueur fin août 2026.

KoboldCpp est-il gratuit ?

Oui. KoboldCpp est gratuit et open source sous licence AGPL 3.0. Il n'existe aucune offre payante ni produit hébergé — chaque déploiement de KoboldCpp tourne sur du matériel que vous contrôlez.

Sous quelle licence KoboldCpp est-il publié ?

AGPL 3.0 (GNU Affero General Public License version 3), une licence copyleft. Cela diffère de la licence MIT utilisée par llama.cpp, le moteur sur lequel repose KoboldCpp.

KoboldCpp nécessite-t-il une installation ?

Non. Il est distribué comme un exécutable unique par plateforme (Windows, Linux, macOS ARM64) — téléchargez-le et lancez-le directement, sans installateur, environnement Python ni conteneur Docker.

KoboldCpp prend-il en charge les GPU AMD ?

Oui, mais pas via le build CUDA principal. Le projet recommande l'option Vulkan dans le build nocuda comme première voie pour AMD, complétée par un build ROCm évolutif maintenu séparément pour Linux.

Qu'est-ce que KoboldAI Lite ?

KoboldAI Lite est l'interface web intégrée dans l'exécutable KoboldCpp. Elle s'ouvre automatiquement dans le navigateur dès que le serveur démarre, avec sortie éditable, champs mémoire/world-info et modes chat, story et adventure dédiés au jeu de rôle et à l'écriture collaborative.

KoboldCpp peut-il générer des images ou transcrire la voix ?

Oui. Le même exécutable embarque la génération d'images Stable Diffusion et la transcription vocale Whisper, en plus de sa fonction principale de génération de texte.

KoboldCpp convient-il à la production ou au multi-utilisateurs ?

Non, ce n'est pas son objectif de conception. KoboldCpp est construit pour un usage local mono-utilisateur avec une interface d'écriture riche ; pour un service de production multi-utilisateurs à forte concurrence, vLLM ou NVIDIA TensorRT-LLM sont les outils appropriés.

Quelle est la différence entre KoboldCpp et Ollama ?

Les deux reposent sur llama.cpp, mais Ollama mise sur une CLI minimale et un registre de modèles sans interface intégrée, tandis que KoboldCpp embarque une interface complète d'écriture et de jeu de rôle dans le navigateur (KoboldAI Lite) au sein du même exécutable unique.

Sources

← Retour aux LLM locaux avancés