Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Le répertoire complet des logiciels LLM locaux : 160+ outils pour faire tourner l'IA sur votre propre matériel (2026)
Overview & Reference

Le répertoire complet des logiciels LLM locaux : 160+ outils pour faire tourner l'IA sur votre propre matériel (2026)

·28 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Ce répertoire 2026 mis à jour (dernière mise à jour en août 2026) cartographie 160+ outils LLM locaux, outils de déploiement, frameworks et systèmes d'IA visuelle en dix couches. L'écosystème LLM local 2026 se divise clairement en dix couches. Les runtimes (Ollama, llama.cpp, vLLM) font circuler les tokens à travers le modèle ; les applications bureau (LM Studio, Jan, GPT4All) encapsulent un runtime dans une interface de chat ; les interfaces web (Open WebUI, LibreChat) font de même dans le navigateur ; les intégrations IDE (Continue.dev, PearAI, Windsurf) connectent un modèle local à votre éditeur de code ; les outils terminal (Aider, ShellGPT, aichat) gèrent les workflows en ligne de commande ; les systèmes RAG (AnythingLLM, PrivateGPT) l'orientent vers vos documents ; les frameworks d'agents (LangChain, CrewAI, LangGraph, SuperAGI) enchaînent les appels en workflows multi-étapes ; les stacks voix et audio (Whisper.cpp, Piper, XTTS) étendent le tout au-delà du texte ; les clients mobiles (MLC Chat, PocketPal AI) le mettent sur téléphone ; les plugins spécialisés (Obsidian, Logseq, AutoGPT) l'intègrent dans vos outils existants ; et les systèmes de génération d'images (Stable Diffusion, ComfyUI, Invoke AI) gèrent les tâches d'IA visuelle. Choisissez d'abord un runtime (Ollama pour presque tout le monde), puis ajoutez une ou deux couches au-dessus.**

Voici un répertoire 2026 mis à jour de 160+ outils, applications, frameworks et logiciels de déploiement LLM locaux — dernière mise à jour en août 2026. L'écosystème LLM local en 2026 s'étend sur dix couches distinctes, et faire les bons choix à chaque couche est essentiel pour construire une stack qui résout votre problème sans surcharge. Ce répertoire recense 160+ projets activement maintenus en dix couches — runtimes, applications bureau, interfaces web, intégrations IDE, outils terminal, systèmes RAG, frameworks d'agents, voix et audio, clients mobiles, plugins spécialisés et génération d'images — avec description, licence et URL pour chacun. Que vous choisissiez des outils LLM locaux, des outils de déploiement pour le service multi-utilisateurs, des frameworks pour construire des agents ou des systèmes visuels, utilisez-le comme carte d'orientation avant de vous engager dans une stack ; chaque catégorie se termine par un lien vers le guide de comparaison PromptQuorum approfondi pour cette couche.

151 tools

Fully local: 76Hybrid: 75Cloud: 0

LM Studio

General chat clients
100% local

Interface la plus aboutie, navigateur HuggingFace intégré, mode serveur

Runs its own engineFree
≈8 GB RAM for a 7B model
Desktop appmacOSWindowsLinux
107 articles
Closed source

Atomic Chat

General chat clients
100% local

Application de chat hors ligne pour ordinateur et mobile avec agents locaux en un clic

Runs its own engineFree
≈8 GB RAM for a 7B model
Mobile appiOSAndroid
3 articles
Apache 2.0

Msty

General chat clients
Hybrid

UX grand public épurée, support multi-fournisseurs

Own engine + externalFree + paid tier
OllamaLM Studiollama.cppOpenAI API
≈8 GB RAM for a 7B model
Desktop appmacOSWindowsLinux
10 articles
Closed source

Backyard AI

Roleplay & companions
100% local

Client bureau pour le chat de personnages et le jeu de rôle

Runs its own engineFree + paid tier
≈8 GB RAM for a 7B model
Desktop appmacOSWindows
3 articles
Closed source

BoltAI

General chat clients
Hybrid

Client IA de bureau natif pour macOS avec prise en charge d'Ollama

Own engine + externalFree + paid tier
OllamaLM Studio
≈8 GB RAM for a 7B model
Desktop appmacOS
6 articles
Closed source

Draw Things

Image generation
100% local

Génération d'images locale sur macOS et iOS avec Stable Diffusion

Runs its own engineFree
≈8 GB RAM for a 7B model
Desktop appMobile appmacOSiOS
1 article
Closed source

Hanoki

General chat clients
Hybrid

Chat à branches pour macOS, local via Ollama ou API cloud

Own engine + externalFree + paid tier
OllamaOpenAI APIAnthropic APIGoogle Gemini APIOpenRouter
≈8 GB RAM for a 7B model
Desktop appmacOS
1 article
MIT

Open Felix

Autonomous agents
Hybrid

Agent macOS, local sur Apple Silicon ou bascule vers le cloud

Own engine + externalFree + paid tier
≈8 GB RAM for a 7B model
Desktop appmacOS
1 article
Apache 2.0

Osaurus

General chat clients
100% local

App macOS native, modèles locaux via Ollama/MLX/LM Studio

Own engine + externalFree
OllamaLM Studio
≈8 GB RAM for a 7B model
Desktop appmacOS
1 article
MIT

BoBe

General chat clients
100% local

Assistant IA local gratuit pour Mac, sur l'appareil

Runs its own engineFree
≈8 GB RAM for a 7B model
Desktop appmacOS
1 article
Open source

Voxa

Real-time voice agents
Hybrid

Assistant vocal desktop local, voix cloud en option

Own engine + externalFree + paid tier
≈8 GB RAM for a 7B model
Desktop appmacOSWindows
1 article
MIT

Jarvis

Real-time voice agents
100% local

Assistant vocal macOS, 100% hors ligne (Llama, Whisper, Kokoro)

Runs its own engineFree
≈8 GB RAM for a 7B model
Desktop appmacOS
3 articles
Open source

Windsurf

Code assistants & IDE plugins
Hybrid

IDE IA-first avec intégration de modèles locaux

Needs Ollama/LM StudioFree + paid tier
Set by your engine
Desktop appmacOSWindowsLinux
8 articles
Closed source

Sourcegraph Cody

Code assistants & IDE plugins
Hybrid

Assistant de code IA avec support de modèles locaux

Needs Ollama/LM StudioFree + paid tier
Ollama
Set by your engine
Editor / notes pluginmacOSWindowsLinux
4 articles
Apache 2.0

CodeGPT

Code assistants & IDE plugins
Hybrid

Intégrations IDE pour plusieurs éditeurs

Needs Ollama/LM StudioFree + paid tier
OllamaLM Studio
Set by your engine
Editor / notes pluginmacOSWindowsLinux
1 article
MIT

Cursor (local mode)

Code assistants & IDE plugins
Hybrid

Éditeur de code centré IA avec support de modèles locaux

Needs Ollama/LM StudioFree + paid tier
Set by your engine
Desktop appmacOSWindowsLinux
Closed source
Get it ↗

Bodega One Code

Code assistants & IDE plugins
Hybrid

IDE de code IA local-first, BYOLLM via Ollama/LM Studio

Needs Ollama/LM StudioFree
OllamaLM Studiollama.cppLocalAIKoboldCpp
Set by your engine
Editor / notes pluginmacOSWindowsLinux
3 articles
Closed source

Blackbox AI (CLI)

Code assistants & IDE plugins
Hybrid

Génération de code et chat en terminal depuis votre shell

Needs Ollama/LM StudioFree + paid tier
Set by your engine
Command linemacOSWindowsLinux
Apache 2.0
Get it ↗

Hermes Agent

Autonomous agents
Hybrid

Agent IA personnel auto-améliorant, mémoire persistante

Needs Ollama/LM StudioFree
OllamaLM StudiovLLMllama.cpp
Set by your engine
Command linemacOSLinux
1 article
MIT

Msty Go

Autonomous agents
Hybrid

Agent de tâches autonome multi-étapes, local ou cloud

Own engine + externalFree + paid tier
Ollamallama.cpp
≈8 GB RAM for a 7B model
Desktop appmacOSWindowsLinux
3 articles
Closed source

XTTS v2

Voice cloning
100% local

Clonage vocal à partir de courts échantillons audio, support multilingue

Library / SDKFree
Set by the model you load
Library / SDKmacOSWindowsLinux
8 articles
CPML

Ollama vision models

Vision & OCR
100% local

Modèles avec capacités vision via Ollama (Llama 3.2 Vision, LLaVA, etc.)

Needs Ollama/LM StudioFree
Ollama
Set by your engine
Command linemacOSWindowsLinux
4 articles
Various

Idefics

Vision & OCR
100% local

Modèle multimodal open source pour vision et langage

Library / SDKFree
Set by the model you load
Library / SDKmacOSWindowsLinux
2 articles
Apache 2.0

Private LLM

General chat clients
100% local

Application iOS et macOS soignée pour LLM locaux

Runs its own enginePaid
≈8 GB RAM for a 7B model
Mobile appiOSmacOS
14 articles
Closed source

Cette page contient des liens de référence vers des produits tiers. PromptQuorum n'est inscrit à aucun programme d'affiliation — ce sont de simples liens qui ne génèrent aucune commission. Cliquer sur les liens et vos prochaines étapes relèvent entièrement de votre responsabilité. Ces liens ne représentent aucune approbation ou vérification par PromptQuorum.

Stacks courants en production

Pour les lecteurs qui ne souhaitent pas parcourir les neuf catégories : choisissez la stack la plus proche et copiez-la. Chaque ligne associe un objectif concret à une combinaison éprouvée et au matériel minimum réellement nécessaire.

Objectif
Stack
Matériel minimum
Chat occasionnelLM Studio standalone16 Go RAM, pas de GPU
Meilleur équilibre pour utilisateurs avancésOllama + Open WebUI16 Go RAM, GPU optionnel
Chat sur documentsOllama + AnythingLLM16 Go RAM, GPU optionnel
CodageOllama + Continue.dev16 Go RAM + GPU recommandé
Jeu de rôle / créatifKoboldCpp + SillyTavern16 Go RAM, GPU recommandé
Confidentialité professionnelleOllama + Open WebUI + PrivateGPT32 Go RAM + 12 Go VRAM
Mobile / nomadeMLC Chat ou PocketPal AIiPhone 13+ / Pixel 7+
Apple SiliconOllama (backend MLX) ou LM StudioM2/M3/M4/M5 avec 16+ Go unifié
Équipe multi-utilisateursvLLM + Open WebUI32+ Go RAM + multi-GPU
9 configurations LLM locales courantes selon l'objectif : de LM Studio seul (16 Go RAM, sans GPU) à vLLM + Open WebUI pour les équipes (32 Go RAM + multi-GPU), avec Ollama + Open WebUI comme configuration équilibrée recommandée.
9 configurations LLM locales courantes selon l'objectif : de LM Studio seul (16 Go RAM, sans GPU) à vLLM + Open WebUI pour les équipes (32 Go RAM + multi-GPU), avec Ollama + Open WebUI comme configuration équilibrée recommandée.

Points clés

  • Dix couches, 160+ projets, une carte. Runtimes, applications bureau, interfaces web, intégrations IDE, outils terminal, systèmes RAG, frameworks d'agents, voix/audio/vision, clients mobiles, plugins de productivité et génération d'images — presque tous les projets populaires de 2026 s'inscrivent dans exactement une couche.
  • Choisissez d'abord un runtime. Ollama est la valeur par défaut pour ~95 % des utilisateurs ; llama.cpp est le moteur fondateur derrière la plupart des autres outils ; vLLM est le choix de production pour les déploiements multi-utilisateurs sur GPU.
  • La plupart des couches au-dessus du runtime sont optionnelles. Une application bureau OU une interface web suffit pour le chat. Ajoutez une intégration IDE uniquement si vous souhaitez une assistance au code ; des outils terminal uniquement pour des workflows CLI ; un système RAG uniquement pour interroger vos documents ; un framework d'agents uniquement quand les appels ponctuels ne suffisent plus ; la génération d'images uniquement si vous avez besoin de sorties visuelles.
  • La licence compte pour un usage commercial. MIT et Apache 2.0 dominent l'écosystème. AGPL apparaît sur quelques interfaces (text-generation-webui, KoboldCpp, Jan, SillyTavern) — acceptable pour un usage personnel, à examiner avec soin pour un déploiement commercial.
  • Les stacks multi-outils sont la norme. Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion couvre le chat, le RAG, le codage et la génération d'images sur une seule machine, sans compromis. Le tableau « Stacks courants en production » ci-dessous liste les recettes qui fonctionnent réellement en 2026.
Les 10 couches d'une pile LLM locale : 160+ projets actifs couvrant les runtimes (Ollama, llama.cpp, vLLM), applications bureau (LM Studio, Jan, GPT4All), interfaces web, éditeurs IDE, outils terminal, systèmes RAG, frameworks d'agents, voix/audio, clients mobiles, outils spécialisés et génération d'images (Stable Diffusion, ComfyUI).
Les 10 couches d'une pile LLM locale : 160+ projets actifs couvrant les runtimes (Ollama, llama.cpp, vLLM), applications bureau (LM Studio, Jan, GPT4All), interfaces web, éditeurs IDE, outils terminal, systèmes RAG, frameworks d'agents, voix/audio, clients mobiles, outils spécialisés et génération d'images (Stable Diffusion, ComfyUI).

Mise à jour du répertoire

Ce répertoire est révisé tous les six mois et corrigé entre les révisions — dernière mise à jour en août 2026, prochaine révision prévue en novembre 2026. L'extension d'août 2026 a ajouté 72+ nouveaux outils dans tous les niveaux, divisé la couche voix/multimodal en trois couches distinctes (STT, TTS, vision), divisé les assistants de codage en intégrations IDE (4a) et outils terminal (4b), et ajouté une toute nouvelle couche de génération d'images. Tous les liens et licences ont été revérifiés ; les nouvelles entrées (PearAI, Windsurf, Sourcegraph Cody, SuperAGI, Leon AI, Draw Things, Fooocus, StableSwarmUI et d'autres) ont été validées pour leur maintenance active. Critères d'inclusion : le projet est activement maintenu (commits dans les 90 derniers jours), dispose d'une licence open source vérifiable ou d'une déclaration claire sur l'usage commercial, et détient soit une part d'utilisateurs significative en 2026, soit occupe une couche qui serait autrement vide. Les projets inactifs depuis plus de deux cycles de version sont supprimés ; les nouveaux entrants satisfaisant les critères sont ajoutés à la prochaine révision. Pour suggérer un projet, ouvrez une issue ou une PR dans le dépôt PromptQuorum — indiquez l'URL du projet, la licence et une description d'une phrase dans le format ci-dessus.

La CNIL recommande le recours à l'IA locale pour le traitement de données professionnelles sensibles (données médicales, juridiques, financières) afin de limiter les transferts hors de l'espace économique européen.

Sources

Questions fréquemment posées

Quelle est la différence entre un runtime LLM local et une application de bureau ?

Un runtime (Ollama, llama.cpp, vLLM) est le moteur qui charge les poids du modèle et expose une API — généralement compatible OpenAI. Une application de bureau (LM Studio, Jan, GPT4All) est une interface de chat qui appelle un runtime en arrière-plan. Certaines applications intègrent leur propre runtime (LM Studio embarque llama.cpp), d'autres nécessitent une installation séparée (Open WebUI appelle Ollama). Le runtime détermine ce qui est possible ; l'application détermine ce qui est pratique.

Puis-je utiliser plusieurs outils de cette liste simultanément ?

Oui — la plupart des stacks combinent 2 à 4 outils. Une configuration courante : Ollama comme runtime, Open WebUI pour le chat, AnythingLLM pour le chat sur documents et Continue.dev pour le codage — les quatre s'appuient sur la même instance Ollama sur une seule machine. Le tableau « Stacks courants en production » liste les recettes qui fonctionnent sans conflit.

Quels outils fonctionnent entièrement hors ligne sans télémétrie ?

Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM et la plupart des applications sous licence AGPL/MIT fonctionnent entièrement hors ligne une fois le modèle téléchargé. LM Studio et plusieurs outils propriétaires disposent d'analyses optionnelles désactivables dans les paramètres — vérifiez avec une capture réseau après l'installation. Les interfaces web (Open WebUI, LibreChat) sont locales lorsqu'elles sont configurées avec un backend local.

Certains de ces outils sont-ils sous licence commerciale (non libres pour un usage commercial) ?

Quelques-uns : LM Studio, Msty, Backyard AI, Layla et Cursor sont propriétaires — généralement gratuits à l'usage mais non redistribuables, et les conditions commerciales varient. Private LLM est payant. Les outils sous licence AGPL (Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Copilot for Obsidian) sont libres pour tout usage y compris commercial, mais les conditions AGPL exigent la divulgation du code source si vous les modifiez et les hébergez publiquement. Les projets Apache 2.0 et MIT (la majorité) sont utilisables dans tout contexte sans contraintes significatives.

Quels outils supportent Apple Silicon (puces M) nativement ?

Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM et la plupart des applications Electron/Tauri fonctionnent nativement sur Apple Silicon avec le backend Metal. MLX-LM est spécifique à Apple et le plus rapide sur M-series pour les grands modèles. vLLM, TensorRT-LLM et ExLlamaV2 sont centrés NVIDIA et ne fonctionnent pas ou mal sur Apple Silicon — pour les utilisateurs Apple, Ollama avec le backend Metal est la recommandation par défaut.

Tous ces outils supportent-ils le format GGUF ?

GGUF est le format natif de llama.cpp et tout outil qui s'appuie dessus (Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile). vLLM et TensorRT-LLM utilisent leurs propres formats optimisés (généralement AWQ ou FP16). ExLlamaV2 utilise la quantification EXL2. MLX-LM utilise des poids convertis MLX. La plupart des outils listés acceptent GGUF ; quelques-uns (vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM) nécessitent une étape de conversion à partir des poids Hugging Face d'origine.

Quels outils conviennent aux utilisateurs sans expérience en programmation ?

GPT4All offre l'installation la plus simple (un clic, fonctionne avec 8 Go RAM). LM Studio est le plus riche en fonctionnalités sans nécessiter de terminal. Jan est l'option sans code la plus axée vie privée. Pour le chat sur documents sans ligne de commande, AnythingLLM est le plus simple. Les quatre sont listés dans la catégorie Applications de bureau ci-dessus.

Puis-je faire tourner ces outils sur un serveur et y accéder à distance ?

La plupart des outils serveur (Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM) exposent une API HTTP et se lient à une interface réseau configurable dans les paramètres. Schéma habituel : Ollama sur un serveur domestique ou VPS, une interface sur votre ordinateur portable ou téléphone pointant vers l'IP du serveur. Traitez l'API comme tout service web — liez à localhost derrière un proxy inverse, ou à un réseau privé avec authentification. Open WebUI inclut le support multi-utilisateurs nativement.

Quels outils supportent les setups multi-utilisateurs / équipe ?

Open WebUI, LibreChat, h2oGPT, AnythingLLM (avec les fonctionnalités admin activées) et Dify sont conçus pour un usage multi-utilisateurs, avec contrôle d'accès basé sur les rôles et historique de conversations par utilisateur. vLLM est la bonne couche de serving en dessous lorsque l'inférence simultanée est importante — il regroupe les requêtes de plusieurs utilisateurs pour un débit inatteignable avec Ollama au-delà de ~3 requêtes simultanées.

À quelle fréquence ce répertoire est-il mis à jour ?

Tous les six mois — dernière révision en août 2026, la prochaine révision planifiée est en novembre 2026. Les modifications intermédiaires (un projet devient inactif, un nouvel outil gagne des parts de marché, une licence change) sont intégrées comme correctifs. Les catégories ou couches entièrement nouvelles (comme l'ajout de la couche génération d'images en août 2026) sont ajoutées lors des révisions planifiées pour maintenir la stabilité de la structure. La section « Sources » liste les index communautaires utilisés pour surveiller l'écosystème entre les révisions.

Puis-je faire de la génération d'images en local, sans appel cloud ?

Oui — Stable Diffusion, ComfyUI, Invoke AI, AUTOMATIC1111 WebUI et d'autres outils du niveau 10 fonctionnent entièrement sur votre matériel local. Stable Diffusion nécessite 6+ Go de VRAM (RTX 3060, RTX 4060 ou équivalent) ; Fooocus et d'autres interfaces optimisées peuvent tourner avec 4-6 Go. Real-ESRGAN agrandit les images générées ; ControlNet ajoute un contrôle spatial (contours, poses, cartes de profondeur) ; AnimateDiff génère de la vidéo à partir de texte. Aucune donnée n'est envoyée à des serveurs externes.

Parcourez les diapositives ci-dessous ou téléchargez en PDF. Télécharger la fiche de référence (PDF)

About this data

This directory is compiled with AI-assisted research from public sources (project READMEs, official sites, GitHub repositories). It is not exhaustive and may contain errors — hardware requirements, pricing, and platform support change frequently and some fields have not been independently verified yet.

Most entries carry no status badge: they are listed from public sources but not independently reviewed. A "Verified" badge means core facts (license, platforms, pricing) have been manually checked. A "PromptQuorum-tested" badge is only shown for tools PromptQuorum has actually installed and run — most entries do not have this badge yet.

The "PromptQuorum-tested" badge is reserved for tools we have personally installed and run — an untested tool never carries it, regardless of popularity or stars.

Spotted something wrong? Email hello@promptquorum.com and we will correct it.

← Retour aux LLM locaux avancés