Stacks courants en production
Pour les lecteurs qui ne souhaitent pas parcourir les neuf catégories : choisissez la stack la plus proche et copiez-la. Chaque ligne associe un objectif concret à une combinaison éprouvée et au matériel minimum réellement nécessaire.
Objectif | Stack | Matériel minimum |
|---|---|---|
| Chat occasionnel | LM Studio standalone | 16 Go RAM, pas de GPU |
| Meilleur équilibre pour utilisateurs avancés | Ollama + Open WebUI | 16 Go RAM, GPU optionnel |
| Chat sur documents | Ollama + AnythingLLM | 16 Go RAM, GPU optionnel |
| Codage | Ollama + Continue.dev | 16 Go RAM + GPU recommandé |
| Jeu de rôle / créatif | KoboldCpp + SillyTavern | 16 Go RAM, GPU recommandé |
| Confidentialité professionnelle | Ollama + Open WebUI + PrivateGPT | 32 Go RAM + 12 Go VRAM |
| Mobile / nomade | MLC Chat ou PocketPal AI | iPhone 13+ / Pixel 7+ |
| Apple Silicon | Ollama (backend MLX) ou LM Studio | M2/M3/M4/M5 avec 16+ Go unifié |
| Équipe multi-utilisateurs | vLLM + Open WebUI | 32+ Go RAM + multi-GPU |
Points clés
- Dix couches, 160+ projets, une carte. Runtimes, applications bureau, interfaces web, intégrations IDE, outils terminal, systèmes RAG, frameworks d'agents, voix/audio/vision, clients mobiles, plugins de productivité et génération d'images — presque tous les projets populaires de 2026 s'inscrivent dans exactement une couche.
- Choisissez d'abord un runtime. Ollama est la valeur par défaut pour ~95 % des utilisateurs ; llama.cpp est le moteur fondateur derrière la plupart des autres outils ; vLLM est le choix de production pour les déploiements multi-utilisateurs sur GPU.
- La plupart des couches au-dessus du runtime sont optionnelles. Une application bureau OU une interface web suffit pour le chat. Ajoutez une intégration IDE uniquement si vous souhaitez une assistance au code ; des outils terminal uniquement pour des workflows CLI ; un système RAG uniquement pour interroger vos documents ; un framework d'agents uniquement quand les appels ponctuels ne suffisent plus ; la génération d'images uniquement si vous avez besoin de sorties visuelles.
- La licence compte pour un usage commercial. MIT et Apache 2.0 dominent l'écosystème. AGPL apparaît sur quelques interfaces (text-generation-webui, KoboldCpp, Jan, SillyTavern) — acceptable pour un usage personnel, à examiner avec soin pour un déploiement commercial.
- Les stacks multi-outils sont la norme. Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion couvre le chat, le RAG, le codage et la génération d'images sur une seule machine, sans compromis. Le tableau « Stacks courants en production » ci-dessous liste les recettes qui fonctionnent réellement en 2026.
Mise à jour du répertoire
Ce répertoire est révisé tous les six mois et corrigé entre les révisions — dernière mise à jour en août 2026, prochaine révision prévue en novembre 2026. L'extension d'août 2026 a ajouté 72+ nouveaux outils dans tous les niveaux, divisé la couche voix/multimodal en trois couches distinctes (STT, TTS, vision), divisé les assistants de codage en intégrations IDE (4a) et outils terminal (4b), et ajouté une toute nouvelle couche de génération d'images. Tous les liens et licences ont été revérifiés ; les nouvelles entrées (PearAI, Windsurf, Sourcegraph Cody, SuperAGI, Leon AI, Draw Things, Fooocus, StableSwarmUI et d'autres) ont été validées pour leur maintenance active. Critères d'inclusion : le projet est activement maintenu (commits dans les 90 derniers jours), dispose d'une licence open source vérifiable ou d'une déclaration claire sur l'usage commercial, et détient soit une part d'utilisateurs significative en 2026, soit occupe une couche qui serait autrement vide. Les projets inactifs depuis plus de deux cycles de version sont supprimés ; les nouveaux entrants satisfaisant les critères sont ajoutés à la prochaine révision. Pour suggérer un projet, ouvrez une issue ou une PR dans le dépôt PromptQuorum — indiquez l'URL du projet, la licence et une description d'une phrase dans le format ci-dessus.
La CNIL recommande le recours à l'IA locale pour le traitement de données professionnelles sensibles (données médicales, juridiques, financières) afin de limiter les transferts hors de l'espace économique européen.
Sources
- ggml-org/llama.cpp GitHub — Source principale pour l'architecture du runtime et les modèles supportés.
- Ollama Library — Catalogue officiel de modèles et documentation du runtime.
- LM Studio Documentation — Référence des fonctionnalités de l'application bureau dominante.
- Open WebUI Documentation — Référence des fonctionnalités de l'interface web auto-hébergée dominante.
- Hugging Face Hub — Source principale de téléchargement des poids de modèles utilisés par chaque runtime listé.
- awesome-local-llm GitHub — Inventaire communautaire utilisé comme vérification de l'inclusion des projets.
Questions fréquemment posées
Quelle est la différence entre un runtime LLM local et une application de bureau ?
Un runtime (Ollama, llama.cpp, vLLM) est le moteur qui charge les poids du modèle et expose une API — généralement compatible OpenAI. Une application de bureau (LM Studio, Jan, GPT4All) est une interface de chat qui appelle un runtime en arrière-plan. Certaines applications intègrent leur propre runtime (LM Studio embarque llama.cpp), d'autres nécessitent une installation séparée (Open WebUI appelle Ollama). Le runtime détermine ce qui est possible ; l'application détermine ce qui est pratique.
Puis-je utiliser plusieurs outils de cette liste simultanément ?
Oui — la plupart des stacks combinent 2 à 4 outils. Une configuration courante : Ollama comme runtime, Open WebUI pour le chat, AnythingLLM pour le chat sur documents et Continue.dev pour le codage — les quatre s'appuient sur la même instance Ollama sur une seule machine. Le tableau « Stacks courants en production » liste les recettes qui fonctionnent sans conflit.
Quels outils fonctionnent entièrement hors ligne sans télémétrie ?
Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM et la plupart des applications sous licence AGPL/MIT fonctionnent entièrement hors ligne une fois le modèle téléchargé. LM Studio et plusieurs outils propriétaires disposent d'analyses optionnelles désactivables dans les paramètres — vérifiez avec une capture réseau après l'installation. Les interfaces web (Open WebUI, LibreChat) sont locales lorsqu'elles sont configurées avec un backend local.
Certains de ces outils sont-ils sous licence commerciale (non libres pour un usage commercial) ?
Quelques-uns : LM Studio, Msty, Backyard AI, Layla et Cursor sont propriétaires — généralement gratuits à l'usage mais non redistribuables, et les conditions commerciales varient. Private LLM est payant. Les outils sous licence AGPL (Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Copilot for Obsidian) sont libres pour tout usage y compris commercial, mais les conditions AGPL exigent la divulgation du code source si vous les modifiez et les hébergez publiquement. Les projets Apache 2.0 et MIT (la majorité) sont utilisables dans tout contexte sans contraintes significatives.
Quels outils supportent Apple Silicon (puces M) nativement ?
Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM et la plupart des applications Electron/Tauri fonctionnent nativement sur Apple Silicon avec le backend Metal. MLX-LM est spécifique à Apple et le plus rapide sur M-series pour les grands modèles. vLLM, TensorRT-LLM et ExLlamaV2 sont centrés NVIDIA et ne fonctionnent pas ou mal sur Apple Silicon — pour les utilisateurs Apple, Ollama avec le backend Metal est la recommandation par défaut.
Tous ces outils supportent-ils le format GGUF ?
GGUF est le format natif de llama.cpp et tout outil qui s'appuie dessus (Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile). vLLM et TensorRT-LLM utilisent leurs propres formats optimisés (généralement AWQ ou FP16). ExLlamaV2 utilise la quantification EXL2. MLX-LM utilise des poids convertis MLX. La plupart des outils listés acceptent GGUF ; quelques-uns (vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM) nécessitent une étape de conversion à partir des poids Hugging Face d'origine.
Quels outils conviennent aux utilisateurs sans expérience en programmation ?
GPT4All offre l'installation la plus simple (un clic, fonctionne avec 8 Go RAM). LM Studio est le plus riche en fonctionnalités sans nécessiter de terminal. Jan est l'option sans code la plus axée vie privée. Pour le chat sur documents sans ligne de commande, AnythingLLM est le plus simple. Les quatre sont listés dans la catégorie Applications de bureau ci-dessus.
Puis-je faire tourner ces outils sur un serveur et y accéder à distance ?
La plupart des outils serveur (Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM) exposent une API HTTP et se lient à une interface réseau configurable dans les paramètres. Schéma habituel : Ollama sur un serveur domestique ou VPS, une interface sur votre ordinateur portable ou téléphone pointant vers l'IP du serveur. Traitez l'API comme tout service web — liez à localhost derrière un proxy inverse, ou à un réseau privé avec authentification. Open WebUI inclut le support multi-utilisateurs nativement.
Quels outils supportent les setups multi-utilisateurs / équipe ?
Open WebUI, LibreChat, h2oGPT, AnythingLLM (avec les fonctionnalités admin activées) et Dify sont conçus pour un usage multi-utilisateurs, avec contrôle d'accès basé sur les rôles et historique de conversations par utilisateur. vLLM est la bonne couche de serving en dessous lorsque l'inférence simultanée est importante — il regroupe les requêtes de plusieurs utilisateurs pour un débit inatteignable avec Ollama au-delà de ~3 requêtes simultanées.
À quelle fréquence ce répertoire est-il mis à jour ?
Tous les six mois — dernière révision en août 2026, la prochaine révision planifiée est en novembre 2026. Les modifications intermédiaires (un projet devient inactif, un nouvel outil gagne des parts de marché, une licence change) sont intégrées comme correctifs. Les catégories ou couches entièrement nouvelles (comme l'ajout de la couche génération d'images en août 2026) sont ajoutées lors des révisions planifiées pour maintenir la stabilité de la structure. La section « Sources » liste les index communautaires utilisés pour surveiller l'écosystème entre les révisions.
Puis-je faire de la génération d'images en local, sans appel cloud ?
Oui — Stable Diffusion, ComfyUI, Invoke AI, AUTOMATIC1111 WebUI et d'autres outils du niveau 10 fonctionnent entièrement sur votre matériel local. Stable Diffusion nécessite 6+ Go de VRAM (RTX 3060, RTX 4060 ou équivalent) ; Fooocus et d'autres interfaces optimisées peuvent tourner avec 4-6 Go. Real-ESRGAN agrandit les images générées ; ControlNet ajoute un contrôle spatial (contours, poses, cartes de profondeur) ; AnimateDiff génère de la vidéo à partir de texte. Aucune donnée n'est envoyée à des serveurs externes.