Skip to main content
PromptQuorum
Accueil/Le répertoire complet des logiciels LLM locaux : 224 outils pour faire tourner l'IA sur votre propre matériel (2026)
Overview & Reference

Le répertoire complet des logiciels LLM locaux : 224 outils pour faire tourner l'IA sur votre propre matériel (2026)

·28 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Ce répertoire 2026 mis à jour (dernière mise à jour en août 2026) cartographie 224 outils LLM locaux, outils de déploiement, frameworks et systèmes d'IA visuelle en dix couches. L'écosystème LLM local 2026 se divise clairement en dix couches. Les runtimes (Ollama, llama.cpp, vLLM) font circuler les tokens à travers le modèle ; les applications bureau (LM Studio, Jan, GPT4All) encapsulent un runtime dans une interface de chat ; les interfaces web (Open WebUI, LibreChat) font de même dans le navigateur ; les intégrations IDE (Continue.dev, PearAI, Windsurf) connectent un modèle local à votre éditeur de code ; les outils terminal (Aider, ShellGPT, aichat) gèrent les workflows en ligne de commande ; les systèmes RAG (AnythingLLM, PrivateGPT) l'orientent vers vos documents ; les frameworks d'agents (LangChain, CrewAI, LangGraph, SuperAGI) enchaînent les appels en workflows multi-étapes ; les stacks voix et audio (Whisper.cpp, Piper, XTTS) étendent le tout au-delà du texte ; les clients mobiles (MLC Chat, PocketPal AI) le mettent sur téléphone ; les plugins spécialisés (Obsidian, Logseq, AutoGPT) l'intègrent dans vos outils existants ; et les systèmes de génération d'images (Stable Diffusion, ComfyUI, Invoke AI) gèrent les tâches d'IA visuelle. Choisissez d'abord un runtime (Ollama pour presque tout le monde), puis ajoutez une ou deux couches au-dessus.**

224 outils LLM locaux répartis en 7 catégories — Run & Serve, Chat & Assistants, Code & Development, Knowledge & Retrieval, Voice & Audio, Images & Video et Train & Operate. Filtrez, recherchez et comparez ci-dessous.

224 outils

Entièrement local: 121Hybride: 103Cloud: 0

Ollama

Moteurs d'inférence
100 % local

Le plus simple — installation en une commande, API compatible OpenAI, vaste bibliothèque de modèles

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Ligne de commandeApplication de bureaumacOSWindowsLinux
180,722283 articles
Article dédié

llama.cpp

Moteurs d'inférence
100 % local

Moteur C++ fondateur derrière la plupart des autres outils, fonctionne partout dont Apple Silicon

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Ligne de commandeBibliothèque / SDKmacOSWindowsLinux
126,800150 articles
Article dédié

vLLM

Moteurs d'inférence
100 % local

Serving haute performance pour déploiements GPU multi-utilisateurs

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Ligne de commandeBibliothèque / SDKLinux
90,80091 articles
Article dédié

text-generation-webui

Moteurs d'inférence
100 % local

Interface power-user avec écosystème de plugins étendu

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Application webLigne de commandeWindowsLinuxmacOS
47,60015 articles
Article dédié

exo

Moteurs d'inférence
100 % local

Inférence distribuée — exécutez de grands modèles en regroupant la puissance de calcul de plusieurs appareils du quotidien

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Ligne de commandemacOSLinux
47,2602 articles
Article dédié

SGLang

Moteurs d'inférence
100 % local

Serving d'inférence structurée pour pipelines d'agents

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Ligne de commandeBibliothèque / SDKLinux
33,5009 articles
Article dédié

Llamafile

Moteurs d'inférence
100 % local

Exécution LLM portable en fichier unique par Mozilla

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Ligne de commandemacOSWindowsLinux
25,9006 articles
Article dédié

MLC LLM

Moteurs d'inférence
100 % local

Runtime de déploiement pour appareils mobiles et edge

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Bibliothèque / SDKApplication mobilemacOSWindowsLinuxiOSAndroid
23,1346 articles
Article dédié

oMLX

Moteurs d'inférence
100 % local

Serveur d'inférence local basé sur MLX pour Apple Silicon avec mise en cache SSD paginée, conçu pour alimenter des agents de codage locaux

Fonctionne avec son propre moteurGratuit
Claude CodeCursorOpenClaw
Dépend du modèle utilisé
Application de bureauLigne de commandemacOS
21,8596 articles
Article dédié

TensorRT-LLM

Moteurs d'inférence
100 % local

Inférence optimisée NVIDIA pour configurations GPU enterprise

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Ligne de commandeBibliothèque / SDKWindowsLinux
14,50010 articles
Article dédié

OpenLLM

Moteurs d'inférence
Hybride

Serveur d'inférence auto-hébergeable qui exécute des LLM open source comme DeepSeek et Llama derrière une API compatible OpenAI

Fonctionne avec son propre moteurGratuit
LlamaDeepSeekQwen
Dépend du modèle utilisé
Ligne de commandeBibliothèque / SDK
12,5351 article
Article dédié

KoboldCpp

Moteurs d'inférence
100 % local

Wrapper llama.cpp léger avec interface intégrée

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Ligne de commandeApplication webWindowsLinuxmacOS
11,60013 articles
Article dédié

MLX-LM

Moteurs d'inférence
100 % local

Runtime natif Apple Silicon par Apple Research

Fonctionne avec son propre moteurGratuit
Dépend du modèle utilisé
Ligne de commandeBibliothèque / SDKmacOS
8,90010 articles
Article dédié

NVIDIA Dynamo

Moteurs d'inférence
100 % local

Framework auto-hébergé de service d'inférence distribuée à l'échelle d'un datacenter pour de grands déploiements LLM sur plusieurs GPU et nœuds

Nécessite Ollama/LM StudioGratuit
vLLMTensorRT-LLMSGLangKubernetes
Dépend du modèle utilisé
Ligne de commandeBibliothèque / SDKLinux
8,1133 articles
Article dédié

LMDeploy

Moteurs d'inférence
100 % local

Boîte à outils auto-hébergée pour compresser, quantifier et servir des LLM avec un moteur d'inférence compatible OpenAI à haut débit

Fonctionne avec son propre moteurGratuit
InternLMLlamaQwenBaichuanDeepSeek
Dépend du modèle utilisé
Ligne de commandeBibliothèque / SDKLinux
8,0805 articles
Article dédié

TurboFieldfare

Moteurs d'inférence
100 % local

Runtime natif Swift et Metal qui exécute Gemma 4 26B-A4B localement avec environ 2 Go de RAM sur tout MacBook série M

Fonctionne avec son propre moteurGratuit
Gemma
2 Go de RAM min.
Application de bureauLigne de commandemacOS
6,7682 articles
Article dédié

Shimmy

Moteurs d'inférence
100 % local

Serveur d'inférence compatible OpenAI en Rust pur, en un seul binaire, qui sert des modèles GGUF et SafeTensors locaux sans dépendance à Python ou llama.cpp

Fonctionne avec son propre moteurGratuit
GGUFSafeTensors
Dépend du modèle utilisé
Ligne de commandemacOSWindowsLinux
5,8902 articles
Article dédié

ExLlamaV2

Moteurs d'inférence
100 % local

Inférence quantifiée rapide, optimisée pour les GPU RTX

Fonctionne avec son propre moteurGratuit
8 Go de VRAM min.
Ligne de commandeBibliothèque / SDKWindowsLinux
4,6004 articles
Article dédié

LoRAX

Moteurs d'inférence
100 % local

Serveur d’inférence auto-hébergé qui sert des milliers d’adaptateurs LoRA finement ajustés sur un seul GPU sans coût par adaptateur

Moteur propre + externeGratuit
HuggingFacePEFTLudwigDocker
Dépend du modèle utilisé
Ligne de commandeBibliothèque / SDKLinux
3,8322 articles
Article dédié

Rapid-MLX

Moteurs d'inférence
100 % local

Moteur d’inférence local compatible OpenAI pour Apple Silicon, conçu comme backend prêt à l’emploi pour Claude Code, Cursor et Aider

Fonctionne avec son propre moteurGratuit
Claude CodeCursorAiderCline
8 Go de RAM min.
Ligne de commandemacOS
3,7734 articles
Article dédié

claude-code-local

Moteurs d'inférence
100 % local

Serveur local natif MLX qui permet à Claude Code de fonctionner à 100% sur l’appareil sous Apple Silicon, sans cloud ni frais d’API

Fonctionne avec son propre moteurGratuit
Claude Code
Dépend du modèle utilisé
Ligne de commandemacOS
3,3141 article
Article dédié

Lucebox

Moteurs d'inférence
100 % local

Serveur d’inférence LLM local avec noyaux optimisés à la main et décodage spéculatif pour des GPU grand public spécifiques

Fonctionne avec son propre moteurGratuit
Claude CodeCodexOpenCodeOpen WebUIGGUF
Dépend du modèle utilisé
Ligne de commandeBibliothèque / SDKLinux
2,8671 article
Article dédié

vllm-mlx

Moteurs d'inférence
100 % local

Serveur d'inférence compatible OpenAI et Anthropic qui apporte le traitement par lots continu façon vLLM sur Apple Silicon via MLX natif.

Fonctionne avec son propre moteurGratuitPrend en charge MCP
Claude CodeOpenAI APIAnthropic API
Dépend du modèle utilisé
Ligne de commandemacOS
1,5803 articles
Article dédié

mlx-serve

Moteurs d'inférence
100 % local

Serveur d'inférence Zig natif pour Apple Silicon servant des modèles MLX et GGUF via des API compatibles OpenAI et Anthropic, avec une application de barre de menu macOS intégrée.

Fonctionne avec son propre moteurGratuitPrend en charge MCP
Claude CodeContinueCursorOpen WebUI
Dépend du modèle utilisé
Ligne de commandeApplication de bureaumacOS
1,3731 article
Article dédié

Cette page contient des liens de référence vers des produits tiers. PromptQuorum n'est inscrit à aucun programme d'affiliation — ce sont de simples liens qui ne génèrent aucune commission. Cliquer sur les liens et vos prochaines étapes relèvent entièrement de votre responsabilité. Ces liens ne représentent aucune approbation ou vérification par PromptQuorum.

Stacks courants en production

Pour les lecteurs qui ne souhaitent pas parcourir les neuf catégories : choisissez la stack la plus proche et copiez-la. Chaque ligne associe un objectif concret à une combinaison éprouvée et au matériel minimum réellement nécessaire.

Objectif
Stack
Matériel minimum
Chat occasionnelLM Studio standalone16 Go RAM, pas de GPU
Meilleur équilibre pour utilisateurs avancésOllama + Open WebUI16 Go RAM, GPU optionnel
Chat sur documentsOllama + AnythingLLM16 Go RAM, GPU optionnel
CodageOllama + Continue.dev16 Go RAM + GPU recommandé
Jeu de rôle / créatifKoboldCpp + SillyTavern16 Go RAM, GPU recommandé
Confidentialité professionnelleOllama + Open WebUI + PrivateGPT32 Go RAM + 12 Go VRAM
Mobile / nomadeMLC Chat ou PocketPal AIiPhone 13+ / Pixel 7+
Apple SiliconOllama (backend MLX) ou LM StudioM2/M3/M4/M5 avec 16+ Go unifié
Équipe multi-utilisateursvLLM + Open WebUI32+ Go RAM + multi-GPU
9 configurations LLM locales courantes selon l'objectif : de LM Studio seul (16 Go RAM, sans GPU) à vLLM + Open WebUI pour les équipes (32 Go RAM + multi-GPU), avec Ollama + Open WebUI comme configuration équilibrée recommandée.
9 configurations LLM locales courantes selon l'objectif : de LM Studio seul (16 Go RAM, sans GPU) à vLLM + Open WebUI pour les équipes (32 Go RAM + multi-GPU), avec Ollama + Open WebUI comme configuration équilibrée recommandée.

Points clés

  • Dix couches, 224 projets, une carte. Runtimes, applications bureau, interfaces web, intégrations IDE, outils terminal, systèmes RAG, frameworks d'agents, voix/audio/vision, clients mobiles, plugins de productivité et génération d'images — presque tous les projets populaires de 2026 s'inscrivent dans exactement une couche.
  • Choisissez d'abord un runtime. Ollama est la valeur par défaut pour ~95 % des utilisateurs ; llama.cpp est le moteur fondateur derrière la plupart des autres outils ; vLLM est le choix de production pour les déploiements multi-utilisateurs sur GPU.
  • La plupart des couches au-dessus du runtime sont optionnelles. Une application bureau OU une interface web suffit pour le chat. Ajoutez une intégration IDE uniquement si vous souhaitez une assistance au code ; des outils terminal uniquement pour des workflows CLI ; un système RAG uniquement pour interroger vos documents ; un framework d'agents uniquement quand les appels ponctuels ne suffisent plus ; la génération d'images uniquement si vous avez besoin de sorties visuelles.
  • La licence compte pour un usage commercial. MIT et Apache 2.0 dominent l'écosystème. AGPL apparaît sur quelques interfaces (text-generation-webui, KoboldCpp, Jan, SillyTavern) — acceptable pour un usage personnel, à examiner avec soin pour un déploiement commercial.
  • Les stacks multi-outils sont la norme. Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion couvre le chat, le RAG, le codage et la génération d'images sur une seule machine, sans compromis. Le tableau « Stacks courants en production » ci-dessous liste les recettes qui fonctionnent réellement en 2026.
Les 10 couches d'une pile LLM locale : 224 projets actifs couvrant les runtimes (Ollama, llama.cpp, vLLM), applications bureau (LM Studio, Jan, GPT4All), interfaces web, éditeurs IDE, outils terminal, systèmes RAG, frameworks d'agents, voix/audio, clients mobiles, outils spécialisés et génération d'images (Stable Diffusion, ComfyUI).
Les 10 couches d'une pile LLM locale : 224 projets actifs couvrant les runtimes (Ollama, llama.cpp, vLLM), applications bureau (LM Studio, Jan, GPT4All), interfaces web, éditeurs IDE, outils terminal, systèmes RAG, frameworks d'agents, voix/audio, clients mobiles, outils spécialisés et génération d'images (Stable Diffusion, ComfyUI).

Mise à jour du répertoire

Ce répertoire est révisé tous les trois mois, avec des mises à jour mensuelles ciblées entre les révisions — dernière mise à jour en août 2026, prochaine révision prévue en novembre 2026. L'extension d'août 2026 a ajouté 72+ nouveaux outils dans tous les niveaux, divisé la couche voix/multimodal en trois couches distinctes (STT, TTS, vision), divisé les assistants de codage en intégrations IDE (4a) et outils terminal (4b), et ajouté une toute nouvelle couche de génération d'images. Tous les liens et licences ont été revérifiés ; les nouvelles entrées (PearAI, Windsurf, Sourcegraph Cody, SuperAGI, Leon AI, Draw Things, Fooocus, StableSwarmUI et d'autres) ont été validées pour leur maintenance active. Critères d'inclusion : le projet est activement maintenu (commits dans les 90 derniers jours), dispose d'une licence open source vérifiable ou d'une déclaration claire sur l'usage commercial, et détient soit une part d'utilisateurs significative en 2026, soit occupe une couche qui serait autrement vide. Les projets inactifs depuis plus de deux cycles de version sont supprimés ; les nouveaux entrants satisfaisant les critères sont ajoutés à la prochaine révision. Pour suggérer un projet, ouvrez une issue ou une PR dans le dépôt PromptQuorum — indiquez l'URL du projet, la licence et une description d'une phrase dans le format ci-dessus.

La CNIL recommande le recours à l'IA locale pour le traitement de données professionnelles sensibles (données médicales, juridiques, financières) afin de limiter les transferts hors de l'espace économique européen.

Sources

Questions fréquemment posées

Quelle est la différence entre un runtime LLM local et une application de bureau ?

Un runtime (Ollama, llama.cpp, vLLM) est le moteur qui charge les poids du modèle et expose une API — généralement compatible OpenAI. Une application de bureau (LM Studio, Jan, GPT4All) est une interface de chat qui appelle un runtime en arrière-plan. Certaines applications intègrent leur propre runtime (LM Studio embarque llama.cpp), d'autres nécessitent une installation séparée (Open WebUI appelle Ollama). Le runtime détermine ce qui est possible ; l'application détermine ce qui est pratique.

Puis-je utiliser plusieurs outils de cette liste simultanément ?

Oui — la plupart des stacks combinent 2 à 4 outils. Une configuration courante : Ollama comme runtime, Open WebUI pour le chat, AnythingLLM pour le chat sur documents et Continue.dev pour le codage — les quatre s'appuient sur la même instance Ollama sur une seule machine. Le tableau « Stacks courants en production » liste les recettes qui fonctionnent sans conflit.

Quels outils fonctionnent entièrement hors ligne sans télémétrie ?

Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM et la plupart des applications sous licence AGPL/MIT fonctionnent entièrement hors ligne une fois le modèle téléchargé. LM Studio et plusieurs outils propriétaires disposent d'analyses optionnelles désactivables dans les paramètres — vérifiez avec une capture réseau après l'installation. Les interfaces web (Open WebUI, LibreChat) sont locales lorsqu'elles sont configurées avec un backend local.

Certains de ces outils sont-ils sous licence commerciale (non libres pour un usage commercial) ?

Quelques-uns : LM Studio, Msty, Backyard AI, Layla et Cursor sont propriétaires — généralement gratuits à l'usage mais non redistribuables, et les conditions commerciales varient. Private LLM est payant. Les outils sous licence AGPL (Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Copilot for Obsidian) sont libres pour tout usage y compris commercial, mais les conditions AGPL exigent la divulgation du code source si vous les modifiez et les hébergez publiquement. Les projets Apache 2.0 et MIT (la majorité) sont utilisables dans tout contexte sans contraintes significatives.

Quels outils supportent Apple Silicon (puces M) nativement ?

Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM et la plupart des applications Electron/Tauri fonctionnent nativement sur Apple Silicon avec le backend Metal. MLX-LM est spécifique à Apple et le plus rapide sur M-series pour les grands modèles. vLLM, TensorRT-LLM et ExLlamaV2 sont centrés NVIDIA et ne fonctionnent pas ou mal sur Apple Silicon — pour les utilisateurs Apple, Ollama avec le backend Metal est la recommandation par défaut.

Tous ces outils supportent-ils le format GGUF ?

GGUF est le format natif de llama.cpp et tout outil qui s'appuie dessus (Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile). vLLM et TensorRT-LLM utilisent leurs propres formats optimisés (généralement AWQ ou FP16). ExLlamaV2 utilise la quantification EXL2. MLX-LM utilise des poids convertis MLX. La plupart des outils listés acceptent GGUF ; quelques-uns (vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM) nécessitent une étape de conversion à partir des poids Hugging Face d'origine.

Quels outils conviennent aux utilisateurs sans expérience en programmation ?

GPT4All offre l'installation la plus simple (un clic, fonctionne avec 8 Go RAM), même si ses propres mises à jour ont ralenti récemment. LM Studio est le plus riche en fonctionnalités sans nécessiter de terminal. Jan est l'option sans code la plus axée vie privée. Pour le chat sur documents sans ligne de commande, AnythingLLM est le plus simple. Les quatre sont listés dans la catégorie Applications de bureau ci-dessus.

Puis-je faire tourner ces outils sur un serveur et y accéder à distance ?

La plupart des outils serveur (Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM) exposent une API HTTP et se lient à une interface réseau configurable dans les paramètres. Schéma habituel : Ollama sur un serveur domestique ou VPS, une interface sur votre ordinateur portable ou téléphone pointant vers l'IP du serveur. Traitez l'API comme tout service web — liez à localhost derrière un proxy inverse, ou à un réseau privé avec authentification. Open WebUI inclut le support multi-utilisateurs nativement.

Quels outils supportent les setups multi-utilisateurs / équipe ?

Open WebUI, LibreChat, h2oGPT, AnythingLLM (avec les fonctionnalités admin activées) et Dify sont conçus pour un usage multi-utilisateurs, avec contrôle d'accès basé sur les rôles et historique de conversations par utilisateur. vLLM est la bonne couche de serving en dessous lorsque l'inférence simultanée est importante — il regroupe les requêtes de plusieurs utilisateurs pour un débit inatteignable avec Ollama au-delà de ~3 requêtes simultanées.

À quelle fréquence ce répertoire est-il mis à jour ?

Tous les trois mois, avec des mises à jour mensuelles ciblées entre les révisions — dernière révision en août 2026, la prochaine révision planifiée est en novembre 2026. Les modifications mensuelles (un projet devient inactif, un nouvel outil gagne des parts de marché, une licence change) sont intégrées comme correctifs. Les catégories ou couches entièrement nouvelles (comme l'ajout de la couche génération d'images en août 2026) sont ajoutées lors des révisions trimestrielles pour maintenir la stabilité de la structure. La section « Sources » liste les index communautaires utilisés pour surveiller l'écosystème entre les révisions.

Puis-je faire de la génération d'images en local, sans appel cloud ?

Oui — Stable Diffusion, ComfyUI, Invoke AI, AUTOMATIC1111 WebUI et d'autres outils du niveau 10 fonctionnent entièrement sur votre matériel local. Stable Diffusion nécessite 6+ Go de VRAM (RTX 3060, RTX 4060 ou équivalent) ; Fooocus et d'autres interfaces optimisées peuvent tourner avec 4-6 Go. Real-ESRGAN agrandit les images générées ; ControlNet ajoute un contrôle spatial (contours, poses, cartes de profondeur) ; AnimateDiff génère de la vidéo à partir de texte. Aucune donnée n'est envoyée à des serveurs externes.

Parcourez les diapositives ci-dessous ou téléchargez en PDF. Télécharger la fiche de référence (PDF)

About this data

This directory is compiled with AI-assisted research from public sources (project READMEs, official sites, GitHub repositories). It is not exhaustive and may contain errors — hardware requirements, pricing, and platform support change frequently and some fields have not been independently verified yet.

Most entries carry no status badge: they are listed from public sources but not independently reviewed. A "Verified" badge means core facts (license, platforms, pricing) have been manually checked. A "PromptQuorum-tested" badge is only shown for tools PromptQuorum has actually installed and run — most entries do not have this badge yet.

The "PromptQuorum-tested" badge is reserved for tools we have personally installed and run — an untested tool never carries it, regardless of popularity or stars.

Spotted something wrong? Email hello@promptquorum.com and we will correct it.

← Retour aux LLM locaux avancés