Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Le répertoire complet des logiciels LLM locaux : 88 outils pour faire tourner l'IA sur votre propre matériel (2026)
Overview & Reference

Le répertoire complet des logiciels LLM locaux : 88 outils pour faire tourner l'IA sur votre propre matériel (2026)

·20 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Ce répertoire 2026 mis à jour (dernière mise à jour en juillet 2026) cartographie 88 outils LLM locaux, outils de déploiement et frameworks en neuf couches. L'écosystème LLM local 2026 se divise clairement en ces couches. Les runtimes (Ollama, llama.cpp, vLLM) font circuler les tokens à travers le modèle ; les applications bureau (LM Studio, Jan, GPT4All) encapsulent un runtime dans une interface de chat ; les interfaces web (Open WebUI, LibreChat) font de même dans le navigateur ; les assistants de codage (Continue.dev, Cline, Aider) connectent un modèle local à votre éditeur ; les systèmes RAG (AnythingLLM, PrivateGPT) l'orientent vers vos documents ; les frameworks d'agents (LangChain, CrewAI, LangGraph) enchaînent les appels en workflows multi-étapes ; les stacks voix et multimodal (Whisper.cpp, Piper, LLaVA) étendent le tout au-delà du texte ; les clients mobiles (MLC Chat, PocketPal AI) le mettent sur téléphone ; et les plugins spécialisés (Obsidian, Logseq, AutoGPT) l'intègrent dans vos outils existants. Choisissez d'abord un runtime (Ollama pour presque tout le monde), puis ajoutez une ou deux couches au-dessus.**

Voici un répertoire 2026 mis à jour de 88 outils, applications, frameworks et logiciels de déploiement LLM locaux — dernière mise à jour en juillet 2026. L'écosystème LLM local en 2026 est assez vaste pour que le mauvais choix initial coûte des heures. Ce répertoire recense 88 projets activement maintenus en neuf couches — runtimes, applications bureau, interfaces web, assistants de codage, systèmes RAG, frameworks d'agents, voix et multimodal, clients mobiles, plugins de productivité — avec description, licence et URL pour chacun. Que vous choisissiez des outils LLM locaux, des outils de déploiement pour le service multi-utilisateurs ou des frameworks pour construire des agents, utilisez-le comme carte d'orientation avant de vous engager dans une stack.

Cette page contient des liens de référence vers des produits tiers. PromptQuorum n'est inscrit à aucun programme d'affiliation — ce sont de simples liens qui ne génèrent aucune commission. Cliquer sur les liens et vos prochaines étapes relèvent entièrement de votre responsabilité. Ces liens ne représentent aucune approbation ou vérification par PromptQuorum.

Présentation: Le répertoire complet des logiciels LLM locaux : 88 outils pour faire tourner l'IA sur votre propre matériel (2026)

La présentation ci-dessous couvre : un aperçu de la stack LLM locale en 9 couches (des runtimes aux plugins spécialisés) ; des tableaux de comparaison de 6 outils pour les runtimes (Ollama/llama.cpp/vLLM), les apps bureau, les interfaces web, les assistants de codage, les systèmes RAG et les frameworks d'agents ; un tableau de stacks réels en 9 lignes (objectif, stack, matériel minimum) ; un guide de sélection en 5 étapes ; et une FAQ. Téléchargez le PDF comme carte de référence pour les logiciels LLM locaux.

Parcourez les diapositives ci-dessous ou téléchargez en PDF. Télécharger la fiche de référence (PDF)

Points clés

  • Neuf couches, 88 projets, une carte. Runtimes, applications bureau, interfaces web, assistants de codage, systèmes RAG, frameworks d'agents, voix/multimodal, clients mobiles et plugins de productivité — presque tous les projets populaires de 2026 s'inscrivent dans exactement une couche.
  • Choisissez d'abord un runtime. Ollama est la valeur par défaut pour ~95 % des utilisateurs ; llama.cpp est le moteur fondateur derrière la plupart des autres outils ; vLLM est le choix de production pour les déploiements multi-utilisateurs sur GPU.
  • La plupart des couches au-dessus du runtime sont optionnelles. Une application bureau OU une interface web suffit pour le chat. Ajoutez un assistant de codage uniquement si vous souhaitez une intégration IDE ; un système RAG uniquement pour interroger vos documents.
  • La licence compte pour un usage commercial. MIT et Apache 2.0 dominent l'écosystème. AGPL apparaît sur quelques interfaces (text-generation-webui, KoboldCpp, Jan, SillyTavern) — acceptable pour un usage personnel, à examiner avec soin pour un déploiement commercial.
  • Les stacks multi-outils sont la norme. Ollama + Open WebUI + AnythingLLM + Continue.dev couvre le chat, le RAG et le codage sur une seule machine. Le tableau « Stacks courants en production » ci-dessous liste les recettes qui fonctionnent réellement en 2026.
Les 9 couches d'une pile LLM locale : 88 projets actifs couvrant les runtimes (Ollama, llama.cpp, vLLM), applications bureau, interfaces web, assistants de code, systèmes RAG, frameworks d'agents, voix & multimodal, clients mobiles et outils spécialisés.
Les 9 couches d'une pile LLM locale : 88 projets actifs couvrant les runtimes (Ollama, llama.cpp, vLLM), applications bureau, interfaces web, assistants de code, systèmes RAG, frameworks d'agents, voix & multimodal, clients mobiles et outils spécialisés.

1. Runtimes & moteurs d'inférence LLM locaux

Un runtime est le moteur qui charge les poids du modèle en mémoire et transforme les invites en tokens. C'est le premier choix d'une stack LLM locale et celui qui conditionne tout ce qui se trouve au-dessus. Ollama domine la part de marché en 2026 grâce à son API compatible OpenAI et son installation en une commande ; llama.cpp est le moteur C++ sous-jacent à la plupart des autres outils ; vLLM est le choix pour les déploiements à accès concurrent sur GPU.

Ollama

Description:
Le plus simple — installation en une commande, API compatible OpenAI, vaste bibliothèque de modèles
Licence:
MIT

llama.cpp

Description:
Moteur C++ fondateur derrière la plupart des autres outils, fonctionne partout dont Apple Silicon
Licence:
MIT

vLLM

Description:
Serving haute performance pour déploiements GPU multi-utilisateurs
Licence:
Apache 2.0

LocalAI

Description:
Remplacement drop-in de l'API OpenAI, compatible avec plusieurs backends
Licence:
MIT

TensorRT-LLM

Description:
Inférence optimisée NVIDIA pour configurations GPU enterprise
Licence:
Apache 2.0

MLC LLM

Description:
Runtime de déploiement pour appareils mobiles et edge
Licence:
Apache 2.0

SGLang

Description:
Serving d'inférence structurée pour pipelines d'agents
Licence:
Apache 2.0

ExLlamaV2

Description:
Inférence quantifiée rapide, optimisée pour les GPU RTX
Licence:
MIT

KoboldCpp

Description:
Wrapper llama.cpp léger avec interface intégrée
Licence:
AGPL 3.0

Llamafile

Description:
Exécution LLM portable en fichier unique par Mozilla
Licence:
Apache 2.0

MLX-LM

Description:
Runtime natif Apple Silicon par Apple Research
Licence:
MIT

Comparatif approfondi : llama.cpp vs Ollama vs vLLM

Ollama vs llama.cpp vs vLLM : Ollama (licence MIT, installation en une commande, API compatible OpenAI) ; llama.cpp (moteur C++ fondamental, MIT) ; vLLM (Apache 2.0, service multi-utilisateurs sur GPU).
Ollama vs llama.cpp vs vLLM : Ollama (licence MIT, installation en une commande, API compatible OpenAI) ; llama.cpp (moteur C++ fondamental, MIT) ; vLLM (Apache 2.0, service multi-utilisateurs sur GPU).

2. Applications de bureau (GUI)

Les applications bureau encapsulent un runtime dans une interface de chat et un navigateur de modèles. C'est le point d'entrée pour la plupart des utilisateurs non techniques — télécharger, cliquer, discuter. LM Studio, Jan et GPT4All détiennent l'essentiel de la base utilisateurs en 2026 ; AnythingLLM fait office d'application bureau et de couche RAG ; Open Interpreter est le cas particulier qui permet à un modèle local de piloter votre ordinateur.

LM Studio

Description:
Interface la plus aboutie, navigateur HuggingFace intégré, mode serveur
Licence:
Gratuit (propriétaire)

Atomic Chat

Description:
Application de chat hors ligne pour ordinateur et mobile avec agents locaux en un clic
Licence:
Apache 2.0

Jan

Link:
jan.ai
Description:
Clone ChatGPT hors ligne axé vie privée, entièrement open source
Licence:
AGPL 3.0

GPT4All

Description:
Accessible aux débutants, excellent support CPU uniquement
Licence:
MIT

AnythingLLM

Description:
RAG et chat sur documents avec store vectoriel intégré
Licence:
MIT

Msty

Description:
UX grand public épurée, support multi-fournisseurs
Licence:
Gratuit (propriétaire)

Cherry Studio

Description:
IA bureau multi-fournisseurs avec personnalisation étendue
Licence:
AGPL 3.0

Backyard AI

Description:
Client bureau pour le chat de personnages et le jeu de rôle
Licence:
Gratuit (propriétaire)

Enchanted

Description:
Client Ollama minimal natif macOS/iOS
Licence:
Apache 2.0

h2oGPT

Description:
Application bureau et serveur riche en fonctionnalités enterprise
Licence:
Apache 2.0

Open Interpreter

Description:
Permet à un LLM local de contrôler votre ordinateur et d'exécuter du code
Licence:
AGPL 3.0

Comparatif approfondi : LM Studio vs Jan vs GPT4All

Vérifier les tarifs Mstylien produit · divulguéVérifier les tarifs AnythingLLM Cloudlien produit · divulgué

3. Interfaces web & frontends navigateur

Les interfaces web sont des clones ChatGPT auto-hébergés — même surface conversationnelle, mais pointant vers un runtime sur votre propre machine ou réseau local. Elles conviennent particulièrement pour un accès multi-appareils ou un usage en équipe. Open WebUI domine le segment auto-hébergé en 2026, LibreChat est l'alternative orientée équipe, SillyTavern est l'interface dédiée au jeu de rôle.

Open WebUI

Description:
Interface auto-hébergée la plus populaire, style ChatGPT, RAG intégré
Licence:
BSD 3-Clause

LibreChat

Description:
Alternative ChatGPT multi-modèles avec fonctionnalités équipe
Licence:
MIT

text-generation-webui

Description:
Interface power-user avec écosystème de plugins étendu
Licence:
AGPL 3.0

SillyTavern

Description:
Jeu de rôle et chat de personnages avec lorebooks
Licence:
AGPL 3.0

LobeChat

Description:
Interface moderne et soignée avec place de marché de plugins
Licence:
MIT

Big-AGI

Description:
Frontend multi-fournisseurs avancé avec personas
Licence:
MIT

NextChat

Description:
Chat web léger, déploiement simplifié
Licence:
MIT

Page Assist

Description:
IA en barre latérale navigateur pour Chrome et Firefox
Licence:
MIT

Chatbox

Description:
Client bureau et web multiplateforme
Licence:
GPLv3

Comparatif approfondi : SillyTavern vs Agnai vs RisuAI

4. Assistants de codage & intégrations IDE

Les assistants de codage connectent un LLM local à votre éditeur ou terminal via des API compatibles OpenAI. Le choix dépend surtout du workflow : autocomplétion dans l'éditeur (Continue.dev), éditions autonomes par agent (Cline, OpenHands) ou éditions diff natives git en terminal (Aider). Les trois patterns fonctionnent avec tout runtime supportant le protocole OpenAI Chat Completions — Ollama est le backend le plus courant en 2026.

Continue.dev

Description:
Autocomplétion et chat VS Code et JetBrains avec modèles locaux
Licence:
Apache 2.0

Aider

Description:
Pair-programmeur en terminal avec support d'édition multi-fichiers
Licence:
Apache 2.0

Cline

Description:
Agent de codage autonome pour VS Code
Licence:
Apache 2.0

Tabby

Description:
Alternative auto-hébergée à GitHub Copilot
Licence:
Apache 2.0

CodeGPT

Description:
Intégrations IDE pour plusieurs éditeurs
Licence:
MIT

OpenHands

Description:
Agent développeur logiciel IA (anciennement OpenDevin)
Licence:
MIT

Cursor (mode local)

Description:
Éditeur de code centré IA avec support de modèles locaux
Licence:
Gratuit (propriétaire)

Twinny

Description:
Alternative Copilot gratuite pour VS Code
Licence:
MIT

Comparatif approfondi : Continue.dev vs Cline vs Aider

3 modes d'assistance au code avec LLM local : Continue.dev pour l'autocomplétion inline dans VS Code et JetBrains, Cline pour les modifications autonomes par agent, Aider pour les diffs git en terminal — tous connectés à Ollama via l'API compatible OpenAI.
3 modes d'assistance au code avec LLM local : Continue.dev pour l'autocomplétion inline dans VS Code et JetBrains, Cline pour les modifications autonomes par agent, Aider pour les diffs git en terminal — tous connectés à Ollama via l'API compatible OpenAI.
Vérifier les tarifs Cursorlien produit · divulgué

5. Systèmes RAG & chat sur documents

**Les systèmes RAG (Retrieval-Augmented Generation) combinent un LLM local avec un modèle d'embedding et un store vectoriel pour que le modèle puisse répondre à partir de vos propres documents.** La distinction est entre les applications clés en main (AnythingLLM, PrivateGPT, Quivr, Khoj) et les bibliothèques de framework (LlamaIndex, Haystack, txtai) sur lesquelles vous construisez. RAGFlow a gagné des parts de marché en 2026 pour les documents nécessitant une extraction de citations précise.

AnythingLLM

Description:
RAG personnel tout-en-un le plus simple, avec espaces de travail
Licence:
MIT

PrivateGPT

Description:
RAG entièrement hors ligne, orienté entreprise
Licence:
Apache 2.0

Quivr

Description:
Assistant de connaissance personnelle auto-hébergé
Licence:
Apache 2.0

Khoj

Description:
Second cerveau IA personnel, synchronisé avec Obsidian et Notion
Licence:
AGPL 3.0

Dify

Link:
dify.ai
Description:
Constructeur de workflows IA avec support RAG et agents
Licence:
Modified Apache 2.0

Flowise

Description:
Constructeur visuel de workflows LangChain
Licence:
Apache 2.0

Langflow

Description:
Orchestration IA visuelle avec composants RAG
Licence:
MIT

LlamaIndex

Description:
Framework RAG / bibliothèque Python — base pour les développements sur mesure
Licence:
MIT

Haystack

Description:
Framework de recherche et RAG par deepset
Licence:
Apache 2.0

RAGFlow

Description:
Compréhension approfondie des documents pour le RAG avec extraction de citations
Licence:
Apache 2.0

txtai

Description:
Base de données vectorielle et LLM intégrée en une seule bibliothèque
Licence:
Apache 2.0

Comparatif approfondi : AnythingLLM vs PrivateGPT vs Open WebUI

RAG local : applications clés en main (AnythingLLM, PrivateGPT, Quivr, RAGFlow, Khoj) pour le chat documentaire sans code vs bibliothèques framework (LlamaIndex, Haystack, Dify, Flowise, txtai) pour des pipelines personnalisés.
RAG local : applications clés en main (AnythingLLM, PrivateGPT, Quivr, RAGFlow, Khoj) pour le chat documentaire sans code vs bibliothèques framework (LlamaIndex, Haystack, Dify, Flowise, txtai) pour des pipelines personnalisés.

6. Frameworks d'agents & orchestration

Les frameworks d'agents transforment les appels LLM en une seule passe en workflows multi-étapes — planifier, agir, observer, répéter. LangChain reste la valeur par défaut généraliste ; CrewAI et AutoGen se spécialisent dans les setups multi-agents basés sur les rôles ; LangGraph est le bon choix lorsque la gestion d'état sur des flux longs est essentielle. Les huit frameworks ci-dessous fonctionnent avec un backend Ollama local.

LangChain

Description:
Framework d'application LLM généraliste
Licence:
MIT

LlamaIndex

Description:
Framework d'agents et de données orienté RAG
Licence:
MIT

CrewAI

Description:
Workflows multi-agents basés sur les rôles
Licence:
MIT

AutoGen

Description:
Framework d'orchestration multi-agents Microsoft
Licence:
CC-BY-4.0 / MIT

Semantic Kernel

Description:
SDK d'orchestration enterprise Microsoft en C#/Python/Java
Licence:
MIT

LangGraph

Description:
Workflows d'agents en graphe avec gestion d'état
Licence:
MIT

Letta (ex-MemGPT)

Description:
Agents avec mémoire à long terme
Licence:
Apache 2.0

Pydantic AI

Description:
Framework d'agents typé construit sur Pydantic
Licence:
MIT

Article approfondi : Agents IA locaux avec MCP

7. Voix, parole & multimodal

Les stacks voix et multimodal étendent un LLM local au-delà du texte — reconnaissance vocale (STT), synthèse vocale (TTS) et vision. Whisper.cpp et faster-whisper dominent la couche STT locale ; Piper et Coqui se partagent la couche TTS avec XTTS v2 en tête pour le clonage vocal ; LLaVA et les modèles vision Ollama couvrent la partie vision. Un assistant vocal entièrement hors ligne est faisable avec cette couche et un petit modèle de chat.

Whisper.cpp

Description:
Reconnaissance vocale locale, fonctionne sur CPU ou GPU
Licence:
MIT

faster-whisper

Description:
Transcription Whisper rapide via CTranslate2
Licence:
MIT

Piper TTS

Description:
Synthèse vocale locale légère
Licence:
MIT

Coqui TTS

Description:
Synthèse vocale open source avec plusieurs options de modèles
Licence:
MPL 2.0

XTTS v2

Description:
Clonage vocal avec support multilingue
Licence:
CPML

Bark

Description:
Synthèse vocale générative avec sons non-verbaux
Licence:
MIT

StyleTTS 2

Description:
TTS naturelle de haute qualité
Licence:
MIT

LLaVA

Description:
Modèle local vision + langage
Licence:
Apache 2.0

Modèles vision Ollama

Description:
Vision locale via Ollama (Llama 3.2 Vision, Llava, etc.)
Licence:
Divers

Article approfondi : Construire un assistant vocal local sur mobile

8. Clients mobiles & edge

Les clients mobiles exécutent un modèle quantifié directement sur le téléphone via Apple Neural Engine, Qualcomm NPU ou inférence CPU pure. Le projet MLC LLM est la couche fondatrice ; les applications grand public (PocketPal AI, Private LLM, LLM Farm, Layla) l'encapsulent dans une interface de chat. Les téléphones haut de gamme 2026 exécutent des modèles 2-4B à des vitesses utilisables (8–15 tokens/sec) ; les modèles 7B sont en limite de faisabilité.

MLC Chat

Description:
Runtime LLM mobile multiplateforme
Licence:
Apache 2.0

PocketPal AI

Description:
Client LLM local gratuit pour iOS et Android
Licence:
MIT

Private LLM

Description:
Application iOS et macOS soignée pour LLM locaux
Licence:
Payant (propriétaire)

LLM Farm

Description:
Client iOS pour LLM locaux avec navigateur de modèles
Licence:
MIT

Layla

Description:
Application LLM local d'abord Android
Licence:
Gratuit (propriétaire)

Maid

Description:
Application Flutter mobile open source pour LLM
Licence:
MIT

Enchanted

Description:
Client Ollama natif iOS/macOS
Licence:
Apache 2.0

Chapper

Description:
Client mobile natif pour Ollama et LM Studio
Licence:
Gratuit

RikkaHub

Description:
IA locale Android open source
Licence:
MIT

AnythingLLM Mobile

Description:
Accès distant à votre espace de travail AnythingLLM local
Licence:
MIT

Article approfondi : Meilleures applications LLM locales pour iPhone en 2026

9. Outils spécialisés & productivité

Les outils spécialisés intègrent les LLM locaux dans des applications déjà utilisées — plateformes de prise de notes (Obsidian, Logseq, Joplin), agents de tâches autonomes (AutoGPT, BabyAGI, MetaGPT) et frontends de jeu de rôle (Agnai, RisuAI). Ce ne sont pas des interfaces de chat génériques ; ce sont des intégrations spécifiques à un workflow qui supposent que vous disposez déjà d'une application hôte et d'un runtime.

Smart Connections

Description:
Plugin Obsidian de recherche sémantique et chat
Licence:
GPL 3.0

Copilot for Obsidian

Description:
Plugin Obsidian de chat LLM local
Licence:
AGPL 3.0

Text Generator

Description:
Plugin Obsidian de génération de contenu
Licence:
MIT

logseq-copilot

Description:
Plugin Logseq pour chat LLM local et cloud, même auteur qu'Obsidian Copilot
Licence:
AGPL 3.0

BMO Chatbot

Description:
Chatbot Obsidian avec LLM local
Licence:
MIT

Joplin AI

Description:
Notes Joplin avec intégrations IA locales
Licence:
MIT

AutoGPT (local)

Description:
Agent de tâches autonome avec support Ollama
Licence:
MIT

BabyAGI

Description:
Agent autonome léger
Licence:
MIT

MetaGPT

Description:
Simulation multi-agents d'une entreprise logicielle
Licence:
MIT

Agnai

Description:
Frontend de jeu de rôle avec cartes de personnages
Licence:
MIT

RisuAI

Description:
Frontend de jeu de rôle adapté au mobile
Licence:
GPL 3.0

Article approfondi : LLM local avec Obsidian en 2026

Stacks courants en production

Pour les lecteurs qui ne souhaitent pas parcourir les neuf catégories : choisissez la stack la plus proche et copiez-la. Chaque ligne associe un objectif concret à une combinaison éprouvée et au matériel minimum réellement nécessaire.

ObjectifStackMatériel minimum
Chat occasionnelLM Studio standalone16 Go RAM, pas de GPU
Meilleur équilibre pour utilisateurs avancésOllama + Open WebUI16 Go RAM, GPU optionnel
Chat sur documentsOllama + AnythingLLM16 Go RAM, GPU optionnel
CodageOllama + Continue.dev16 Go RAM + GPU recommandé
Jeu de rôle / créatifKoboldCpp + SillyTavern16 Go RAM, GPU recommandé
Confidentialité professionnelleOllama + Open WebUI + PrivateGPT32 Go RAM + 12 Go VRAM
Mobile / nomadeMLC Chat ou PocketPal AIiPhone 13+ / Pixel 7+
Apple SiliconOllama (backend MLX) ou LM StudioM2/M3/M4/M5 avec 16+ Go unifié
Équipe multi-utilisateursvLLM + Open WebUI32+ Go RAM + multi-GPU
9 configurations LLM locales courantes selon l'objectif : de LM Studio seul (16 Go RAM, sans GPU) à vLLM + Open WebUI pour les équipes (32 Go RAM + multi-GPU), avec Ollama + Open WebUI comme configuration équilibrée recommandée.
9 configurations LLM locales courantes selon l'objectif : de LM Studio seul (16 Go RAM, sans GPU) à vLLM + Open WebUI pour les équipes (32 Go RAM + multi-GPU), avec Ollama + Open WebUI comme configuration équilibrée recommandée.

Mise à jour du répertoire

Ce répertoire est révisé tous les six mois et corrigé entre les révisions — dernière mise à jour en juillet 2026, prochaine révision prévue en novembre 2026. La dernière révision a revérifié tous les liens et corrigé plusieurs noms de projets et licences : Faraday s'appelle désormais Backyard AI, le fork Coqui TTS maintenu est hébergé par Idiap et Cherry Studio est sous AGPL 3.0. Critères d'inclusion : le projet est activement maintenu (commits dans les 90 derniers jours), dispose d'une licence open source vérifiable ou d'une déclaration claire sur l'usage commercial, et détient soit une part d'utilisateurs significative en 2026, soit occupe une couche qui serait autrement vide. Les projets inactifs depuis plus de deux cycles de version sont supprimés ; les nouveaux entrants satisfaisant les critères sont ajoutés à la prochaine révision. Pour suggérer un projet, ouvrez une issue ou une PR dans le dépôt PromptQuorum — indiquez l'URL du projet, la licence et une description d'une phrase dans le format des tableaux ci-dessus.

La CNIL recommande le recours à l'IA locale pour le traitement de données professionnelles sensibles (données médicales, juridiques, financières) afin de limiter les transferts hors de l'espace économique européen.

Sources

Questions fréquemment posées

Quelle est la différence entre un runtime LLM local et une application de bureau ?

Un runtime (Ollama, llama.cpp, vLLM) est le moteur qui charge les poids du modèle et expose une API — généralement compatible OpenAI. Une application de bureau (LM Studio, Jan, GPT4All) est une interface de chat qui appelle un runtime en arrière-plan. Certaines applications intègrent leur propre runtime (LM Studio embarque llama.cpp), d'autres nécessitent une installation séparée (Open WebUI appelle Ollama). Le runtime détermine ce qui est possible ; l'application détermine ce qui est pratique.

Puis-je utiliser plusieurs outils de cette liste simultanément ?

Oui — la plupart des stacks combinent 2 à 4 outils. Une configuration courante : Ollama comme runtime, Open WebUI pour le chat, AnythingLLM pour le chat sur documents et Continue.dev pour le codage — les quatre s'appuient sur la même instance Ollama sur une seule machine. Le tableau « Stacks courants en production » liste les recettes qui fonctionnent sans conflit.

Quels outils fonctionnent entièrement hors ligne sans télémétrie ?

Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM et la plupart des applications sous licence AGPL/MIT fonctionnent entièrement hors ligne une fois le modèle téléchargé. LM Studio et plusieurs outils propriétaires disposent d'analyses optionnelles désactivables dans les paramètres — vérifiez avec une capture réseau après l'installation. Les interfaces web (Open WebUI, LibreChat) sont locales lorsqu'elles sont configurées avec un backend local.

Certains de ces outils sont-ils sous licence commerciale (non libres pour un usage commercial) ?

Quelques-uns : LM Studio, Msty, Backyard AI, Layla et Cursor sont propriétaires — généralement gratuits à l'usage mais non redistribuables, et les conditions commerciales varient. Private LLM est payant. Les outils sous licence AGPL (Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Open Interpreter, Copilot for Obsidian) sont libres pour tout usage y compris commercial, mais les conditions AGPL exigent la divulgation du code source si vous les modifiez et les hébergez publiquement. Les projets Apache 2.0 et MIT (la majorité) sont utilisables dans tout contexte sans contraintes significatives.

Quels outils supportent Apple Silicon (puces M) nativement ?

Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM et la plupart des applications Electron/Tauri fonctionnent nativement sur Apple Silicon avec le backend Metal. MLX-LM est spécifique à Apple et le plus rapide sur M-series pour les grands modèles. vLLM, TensorRT-LLM et ExLlamaV2 sont centrés NVIDIA et ne fonctionnent pas ou mal sur Apple Silicon — pour les utilisateurs Apple, Ollama avec le backend Metal est la recommandation par défaut.

Tous ces outils supportent-ils le format GGUF ?

GGUF est le format natif de llama.cpp et tout outil qui s'appuie dessus (Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile). vLLM et TensorRT-LLM utilisent leurs propres formats optimisés (généralement AWQ ou FP16). ExLlamaV2 utilise la quantification EXL2. MLX-LM utilise des poids convertis MLX. La plupart des outils listés acceptent GGUF ; quelques-uns (vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM) nécessitent une étape de conversion à partir des poids Hugging Face d'origine.

Quels outils conviennent aux utilisateurs sans expérience en programmation ?

GPT4All offre l'installation la plus simple (un clic, fonctionne avec 8 Go RAM). LM Studio est le plus riche en fonctionnalités sans nécessiter de terminal. Jan est l'option sans code la plus axée vie privée. Pour le chat sur documents sans ligne de commande, AnythingLLM est le plus simple. Les quatre sont listés dans la catégorie Applications de bureau ci-dessus.

Puis-je faire tourner ces outils sur un serveur et y accéder à distance ?

La plupart des outils serveur (Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM) exposent une API HTTP et se lient à une interface réseau configurable dans les paramètres. Schéma habituel : Ollama sur un serveur domestique ou VPS, une interface sur votre ordinateur portable ou téléphone pointant vers l'IP du serveur. Traitez l'API comme tout service web — liez à localhost derrière un proxy inverse, ou à un réseau privé avec authentification. Open WebUI inclut le support multi-utilisateurs nativement.

Quels outils supportent les setups multi-utilisateurs / équipe ?

Open WebUI, LibreChat, h2oGPT, AnythingLLM (avec les fonctionnalités admin activées) et Dify sont conçus pour un usage multi-utilisateurs, avec contrôle d'accès basé sur les rôles et historique de conversations par utilisateur. vLLM est la bonne couche de serving en dessous lorsque l'inférence simultanée est importante — il regroupe les requêtes de plusieurs utilisateurs pour un débit inatteignable avec Ollama au-delà de ~3 requêtes simultanées.

À quelle fréquence ce répertoire est-il mis à jour ?

Tous les six mois — dernière révision en juillet 2026, la prochaine révision planifiée est en novembre 2026. Les modifications intermédiaires (un projet devient inactif, un nouvel outil gagne des parts de marché, une licence change) sont intégrées comme correctifs. Les nouvelles catégories attendent une révision pour maintenir la stabilité de la structure. La section « Sources » liste les index communautaires utilisés pour surveiller l'écosystème entre les révisions.

← Retour aux LLM locaux avancés