Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Ollama Review 2026 : le moteur d'exécution local LLM en une commande
Overview & Reference

Ollama Review 2026 : le moteur d'exécution local LLM en une commande

·13 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Ollama est un outil en ligne de commande gratuit et open source (ollama.com, code source sur github.com/ollama/ollama) qui télécharge et exécute des modèles d'IA ouverts localement via un moteur basé sur llama.cpp, une API REST locale et une application de bureau officielle. Le logiciel principal est sous licence MIT et gratuit, confirmé par le fichier de licence du dépôt ; le dépôt GitHub affiche 180 722 étoiles au 12 septembre 2026, d'après l'API GitHub. Ollama fonctionne sur macOS (14 Sonoma ou ultérieur), Windows et Linux, s'installe en une seule commande de terminal, expose une API compatible OpenAI à http://localhost:11434/v1, et propose séparément une offre cloud payante optionnelle (à partir de 20 $/mois) pour exécuter des modèles plus volumineux sur l'infrastructure hébergée d'Ollama plutôt que sur votre machine.

Ollama (ollama.com, code source sur github.com/ollama/ollama) est un outil gratuit et open source permettant de télécharger et d'exécuter des modèles d'IA ouverts sur votre propre ordinateur via une interface en ligne de commande unique, une API REST locale et, depuis juillet 2025, une application de bureau officielle. Il intègre l'inférence basée sur llama.cpp dans un flux de travail proche de Docker (ollama pull, ollama run), si bien que faire tourner un modèle ne nécessite ni compilation ni configuration manuelle de serveur. Cette review couvre ce qu'Ollama fait réellement, comment l'installer, ses systèmes de Modelfile et d'API, son offre cloud payante optionnelle, et sa place face aux autres outils d'inférence locale.

Ollama Review 2026 : le moteur d'exécution local LLM en une commande

Points clés

  • Ollama est gratuit et open source ; la LICENSE officielle sur GitHub est la licence MIT
  • Exécute des modèles locaux via un moteur intégré basé sur llama.cpp — aucune compilation ou configuration de serveur séparée nécessaire
  • S'installe avec une commande sur macOS/Linux (curl -fsSL https://ollama.com/install.sh | sh) ou une sur Windows (irm https://ollama.com/install.ps1 | iex), plus des installateurs signés, des images Docker et des paquets pour gestionnaires de paquets (Homebrew, Pacman, Nix, et autres)
  • Les modèles personnalisés se définissent avec un Modelfile utilisant les directives FROM, PARAMETER, TEMPLATE, SYSTEM, ADAPTER, LICENSE et MESSAGE
  • Expose à la fois une API REST native (/api/chat, /api/generate) et une API compatible OpenAI à http://localhost:11434/v1 (/v1/chat/completions, /v1/completions, /v1/models, /v1/embeddings)
  • Bibliothèque de modèles sur ollama.com/library, avec des noms de modèles comme llama3.2, gemma4, qwen3.5 et gpt-oss d'après la documentation officielle actuelle
  • ollama launch connecte directement un modèle local à des outils de code comme Claude Code, Codex, VS Code, OpenCode et Droid
  • Développé par Ollama Inc., une entreprise de Palo Alto, en Californie, fondée en 2023 par Jeffrey Morgan et Michael Chiang
  • Disponible sur macOS, Windows et Linux, ainsi que sur Docker Hub (ollama/ollama) et via des gestionnaires de paquets dont Homebrew, Pacman, Nix et Guix

📍 En une phrase

Ollama est un outil en ligne de commande et une API locale gratuits et open source (licence MIT) qui téléchargent et exécutent des modèles d'IA ouverts sur votre propre ordinateur via un moteur basé sur llama.cpp, avec une offre cloud payante optionnelle pour l'inférence hébergée.

💬 En termes simples

Plutôt que de compiler manuellement un moteur d'inférence et d'écrire un serveur autour, Ollama vous donne deux commandes — télécharger un modèle, puis l'exécuter — et s'occupe du reste. Cela fonctionne comme Docker pour les modèles d'IA : une commande télécharge un modèle, une autre l'exécute, et une adresse web locale permet à d'autres programmes de lui parler comme ils parleraient à l'API d'OpenAI.

📌Remarque: Cette review est le complément détaillé de la fiche d'Ollama dans le répertoire des logiciels d'IA locale — consultez cette page pour voir comment Ollama se compare, en un coup d'œil, à des dizaines d'autres outils d'IA locale.

Qu'est-ce qu'Ollama ?

Ollama est un outil en ligne de commande, un serveur API local et (depuis juillet 2025) une application de bureau pour exécuter des modèles d'IA ouverts sur votre propre matériel. Son dépôt GitHub le décrit comme un logiciel permettant de « démarrer avec de grands modèles de langage » localement. La conception reprend délibérément le flux de travail de Docker — les deux cofondateurs avaient auparavant créé Kitematic, une interface graphique pour Docker rachetée par Docker en 2015 — si bien que ollama pull et ollama run fonctionnent de façon très similaire à docker pull et docker run.

  • Fonction principale : télécharger des modèles ouverts et les exécuter localement via un moteur d'inférence intégré, avec une CLI, une API locale et une interface de chat de bureau, toutes connectées au même service en arrière-plan
  • Moteur d'inférence local : construit sur llama.cpp et GGML, exécutant des modèles au format GGUF issus de la propre bibliothèque d'Ollama ou importés depuis des fichiers GGUF/Safetensors
  • Interfaces : une CLI de terminal (ollama run <modèle>), une application de bureau officielle pour macOS et Windows avec glisser-déposer de fichiers et d'images, et une API REST pour un usage programmatique
  • Développeur : Ollama Inc., une entreprise de Palo Alto, en Californie ; l'organisation GitHub hébergeant le code s'appelle ollama
  • Dépôt canonique : github.com/ollama/ollama, sous licence MIT d'après le fichier LICENSE du dépôt

Historique et jalons de l'entreprise Ollama

Ollama a été fondée en 2023 par Jeffrey Morgan et Michael Chiang, qui se sont rencontrés à l'Université de Waterloo et avaient auparavant créé Kitematic, une interface graphique open source pour Docker rachetée par Docker en 2015 (plus tard intégrée à Docker Desktop). Ollama Inc. est basée à Palo Alto, en Californie, et a levé des fonds auprès d'investisseurs dont Benchmark et Theory Ventures, selon des trackers publics de financement de start-up ; PromptQuorum n'a pas pu vérifier de manière indépendante un montant exact de financement auprès d'une source primaire et recommande de consulter les annonces officielles d'Ollama pour des chiffres à jour.

  1. 1
    2023 — Lancement du projet
    Why it matters: Le dépôt GitHub d'Ollama et ses premières versions publiques ont établi le flux de travail CLI `pull`/`run` qui reste aujourd'hui le modèle d'interaction principal.
  2. 2
    Juillet 2025 — Application de bureau officielle lancée
    Why it matters: A ajouté une interface graphique native pour macOS et Windows avec téléchargement de modèles, chat, glisser-déposer de fichiers/images et longueur de contexte ajustable — auparavant, la CLI et des interfaces tierces (comme Open WebUI) étaient les seules options.
  3. 3
    2025–2026 — Extension de l'API compatible OpenAI
    Why it matters: Ollama a ajouté et étendu un point de terminaison compatible OpenAI à `/v1`, couvrant les chat completions, completions, embeddings et le listing de modèles, en faisant un backend prêt à l'emploi pour les outils déjà construits sur le SDK OpenAI.
  4. 4
    2026 — Intégrations ollama launch
    Why it matters: A ajouté une configuration en une commande pour connecter des outils de code — Claude Code, Codex, VS Code, OpenCode et Droid — à un modèle exécuté localement, d'après la [référence CLI officielle](https://docs.ollama.com).
  5. 5
    2026 — Introduction de l'offre cloud
    Why it matters: Ollama Inc. a commencé à proposer une inférence hébergée payante sur sa propre infrastructure (régions incluant les États-Unis, l'Europe et Singapour selon [ollama.com](https://ollama.com)) en option en plus du logiciel local gratuit, pour les utilisateurs souhaitant exécuter des modèles plus volumineux que ne le permet leur propre matériel.

Que pouvez-vous faire avec Ollama ?

L'ensemble des fonctionnalités d'Ollama vise à rendre l'inférence de modèles locale aussi simple qu'un gestionnaire de paquets plutôt qu'un projet de recherche. Voici ce que fait réellement chaque partie, d'après la documentation officielle et le README GitHub d'Ollama.

  • Bibliothèque de modèles — téléchargez des modèles prêts à l'emploi depuis ollama.com/library avec une seule commande ollama pull <modèle> ; la documentation actuelle montre des exemples incluant Llama, Gemma, Qwen, gpt-oss, DeepSeek et des modèles d'embedding dédiés comme nomic-embed-text et embeddinggemma
  • Personnalisation via Modelfile — définissez une configuration de modèle personnalisée avec un Modelfile utilisant les directives FROM (modèle de base, requis), PARAMETER (réglages d'exécution comme la température et la longueur de contexte), TEMPLATE (format de prompt), SYSTEM (prompt système), ADAPTER (adaptateurs LoRA), LICENSE et MESSAGE (historique de conversation pré-rempli), puis compilez-le avec ollama create <nom> -f Modelfile
  • API REST locale — une API native à http://localhost:11434 avec des points de terminaison incluant /api/generate, /api/chat, /api/embeddings, /api/pull et /api/create, documentés dans la référence API officielle
  • API compatible OpenAI — un second point de terminaison à http://localhost:11434/v1 implémentant /v1/chat/completions, /v1/completions, /v1/models et /v1/embeddings, permettant aux applications écrites pour le SDK OpenAI de pointer vers Ollama en ne changeant que l'URL de base
  • Intégrations avec les outils de code (ollama launch) — une commande interactive qui configure des outils externes — Claude Code, Codex, VS Code, OpenCode et Droid sont cités dans la documentation CLI actuelle — pour utiliser un modèle Ollama exécuté localement comme backend
  • Support multimodal et embeddingsollama run accepte des entrées image pour les modèles multimodaux (la documentation CLI cite llava en exemple), et des modèles d'embedding dédiés peuvent être exécutés pour des pipelines de récupération/RAG
  • Application de bureau — une interface graphique native (macOS et Windows, lancée en juillet 2025) pour télécharger des modèles et discuter sans terminal, en complément de la CLI
  • Offre cloud optionnelle — Ollama Inc. vend de l'inférence hébergée sur ses propres serveurs comme option payante séparée pour exécuter des modèles plus volumineux que ce que le matériel local peut gérer ; ceci n'est requis pour aucune des fonctionnalités locales ci-dessus

Exemples d'utilisation : trois façons d'utiliser Ollama

Voici des flux de travail concrets construits à partir des commandes et de l'API documentées d'Ollama ci-dessus — pas des cas d'usage hypothétiques.

Tarifs Ollama : logiciel gratuit, cloud payant optionnel

Le logiciel Ollama — la CLI, l'API locale et l'application de bureau — est gratuit et open source. Le fichier LICENSE GitHub est la licence MIT standard, sans fonctionnalité verrouillée derrière un paiement. Séparément, Ollama Inc. vend un service cloud hébergé sur ollama.com pour exécuter des modèles plus volumineux sur ses propres serveurs plutôt que sur votre machine locale.

Logiciel local

Prix:
Gratuit
Contenu:
CLI, API REST/compatible OpenAI locale, application de bureau, personnalisation Modelfile et bibliothèque de modèles complète — fonctionne entièrement sur votre propre matériel

Cloud (gratuit)

Prix:
Gratuit
Contenu:
Accès hébergé limité à des modèles cloud selon la page de tarifs actuelle de ollama.com

Cloud Pro

Prix:
À partir de 20 $/mois
Contenu:
Crédit d'inférence hébergée et limites d'utilisation plus élevées sur les propres serveurs d'Ollama (régions incluant les États-Unis, l'Europe et Singapour, selon le site d'Ollama) — un produit payant distinct du logiciel local gratuit

Les prix et détails de l'offre cloud changent ; vérifiez directement la page de tarifs d'ollama.com avant toute décision d'achat. Rien dans l'offre cloud payante n'est requis pour installer et utiliser le logiciel local gratuit d'Ollama — le service cloud existe pour les modèles trop volumineux pour la RAM/VRAM d'une machine donnée.

Ollama vs. LM Studio

Ollama et LM Studio comptent parmi les outils les plus fréquemment recommandés pour exécuter des modèles d'IA locaux, et ils sont constamment comparés car tous deux enveloppent une inférence basée sur llama.cpp derrière une interface plus simple. La différence la plus nette est CLI-first contre GUI-first, et open source contre closed source.

Interface principale

Ollama:
D'abord en ligne de commande, avec une interface graphique de bureau officielle ajoutée en juillet 2025
LM Studio:
D'abord une application de bureau graphique ; pas de flux de travail CLI-first

Licence

Ollama:
MIT (entièrement open source)
LM Studio:
Propriétaire — gratuite pour un usage personnel et professionnel selon ses propres conditions d'utilisation, mais pas open source

API locale

Ollama:
API REST native plus point de terminaison compatible OpenAI à :11434/v1
LM Studio:
Point de terminaison REST compatible OpenAI plus une API REST LM Studio bêta séparée

Formats de modèles

Ollama:
GGUF via sa propre bibliothèque et son système de Modelfile
LM Studio:
GGUF (via llama.cpp) et MLX (Apple Silicon)

Chat de documents intégré (RAG)

Ollama:
Pas une fonctionnalité intégrée — à combiner avec un client comme Open WebUI ou AnythingLLM
LM Studio:
Fonctionnalité intégrée « Chat with Documents »

Offre cloud optionnelle

Ollama:
Oui, à partir de 20 $/mois pour l'inférence hébergée
LM Studio:
Oui, « Bionic+ » à partir de 20 $/mois et « Pro » à partir de 100 $/mois pour des modèles hébergés et des limites plus élevées

Si vous voulez un outil scriptable, terminal-first, que d'autres applications peuvent appeler comme backend, le flux de travail d'Ollama convient plus directement. Si vous voulez une seule interface graphique aboutie avec un navigateur de modèles intégré et une fonction de chat de documents sans utiliser de terminal, évaluez LM Studio directement sur lmstudio.ai — voir le LM Studio Review complet pour les détails. Les deux sont gratuits pour leur fonctionnalité locale de base ; vérifiez les fonctionnalités actuelles sur le site de chaque projet avant de décider.

À qui s'adresse Ollama ?

Le choix d'Ollama dépend de votre aisance avec un flux de travail terminal-first et de votre besoin d'un backend scriptable que d'autres outils peuvent appeler.

Ollama face aux autres moteurs locaux

Ollama fait partie de plusieurs outils qui enveloppent l'inférence de modèles locale derrière une interface plus simple. Voici comment il se positionne face à d'autres options dans ce domaine — consultez le répertoire des logiciels d'IA locale pour le catalogue complet, et la comparaison dédiée Ollama vs. LM Studio ci-dessus pour le face-à-face le plus proche.

  • LM Studio — une application de bureau GUI-first couvrant un terrain similaire (inférence locale, API compatible OpenAI) avec un navigateur de modèles intégré et une fonction de chat de documents ; voir le LM Studio Review et la section de comparaison ci-dessus pour un face-à-face direct.
  • llama.cpp — le moteur d'inférence open source sur lequel Ollama lui-même est construit ; l'utiliser directement offre un contrôle de plus bas niveau (drapeaux de compilation personnalisés, chargement direct de GGUF) au prix de la commodité d'Ollama proche d'un gestionnaire de paquets. Voir l'explication de llama.cpp.
  • KoboldCpp — un autre moteur d'exécution basé sur llama.cpp, historiquement populaire pour l'écriture créative et le jeu de rôle, avec une interface web intégrée ; voir le KoboldCpp Review.
  • LocalAI — un moteur d'exécution open source compatible avec l'API OpenAI qui prend en charge une gamme plus large de backends de modèles au-delà de llama.cpp (y compris des modèles d'image et audio) dans un seul serveur ; voir l'explication de LocalAI.

Erreurs courantes en évaluant Ollama

La plupart des confusions autour d'Ollama viennent d'un amalgame entre le logiciel local gratuit et le produit cloud payant distinct, ou d'attentes envers des fonctionnalités (comme un RAG intégré) volontairement non incluses.

Questions fréquentes

Qu'est-ce qu'Ollama ?

Ollama (ollama.com, code source sur github.com/ollama/ollama) est un outil en ligne de commande, une API locale et une application de bureau gratuits et open source pour télécharger et exécuter des modèles d'IA ouverts sur votre propre ordinateur via un moteur intégré basé sur llama.cpp.

Ollama est-il gratuit ?

Oui. Le logiciel principal — CLI, API locale et application de bureau — est sous licence MIT et gratuit, sans fonctionnalité verrouillée derrière un paiement. Ollama Inc. vend séparément une offre cloud payante optionnelle (à partir de 20 $/mois) pour l'inférence hébergée sur ses propres serveurs ; ce produit cloud n'est pas requis pour utiliser le logiciel local gratuit.

Ollama est-il open source ? Quelle licence utilise-t-il ?

Oui. Le fichier LICENSE GitHub d'Ollama est la licence MIT standard, l'une des licences open source les plus permissives, sans obligation de copyleft.

Quelles plateformes Ollama prend-il en charge ?

macOS (14 Sonoma ou ultérieur), Windows et Linux, d'après la page de téléchargement officielle. Il est aussi distribué sous forme d'image Docker (ollama/ollama) et via des gestionnaires de paquets dont Homebrew, Pacman, Nix et Guix.

Ollama a-t-il une interface graphique, ou est-il uniquement en ligne de commande ?

Les deux. Ollama a débuté comme outil en ligne de commande et reste centré sur la CLI, mais Ollama Inc. a lancé une application de bureau officielle pour macOS et Windows en juillet 2025, ajoutant une interface de chat graphique en complément du flux de travail en terminal.

Ollama dispose-t-il d'une API compatible OpenAI ?

Oui. En plus de son API REST native à http://localhost:11434, Ollama expose un point de terminaison compatible OpenAI à http://localhost:11434/v1, couvrant /v1/chat/completions, /v1/completions, /v1/models et /v1/embeddings.

Qu'est-ce qu'un Modelfile ?

Un Modelfile est un fichier de configuration texte utilisé pour construire un modèle Ollama personnalisé. Il prend en charge les directives FROM (modèle de base, requis), PARAMETER, TEMPLATE, SYSTEM, ADAPTER, LICENSE et MESSAGE, et se compile en un modèle exécutable avec ollama create <nom> -f Modelfile.

Combien d'étoiles GitHub Ollama a-t-il ?

Le dépôt d'Ollama (github.com/ollama/ollama) affichait 180 722 étoiles au 12 septembre 2026, vérifié directement via l'API GitHub. Consultez le dépôt directement pour un chiffre à jour, car il change quotidiennement.

Qui développe Ollama ?

Ollama Inc., une entreprise basée à Palo Alto, en Californie, fondée en 2023 par Jeffrey Morgan et Michael Chiang, qui avaient auparavant créé Kitematic, une interface graphique pour Docker rachetée par Docker en 2015.

Ollama inclut-il la génération augmentée par récupération (RAG) ou le chat de documents ?

Pas de façon intégrée. Ollama fournit le moteur d'inférence et l'API ; les fonctionnalités de chat de documents et de RAG proviennent généralement d'une couche client séparée qui s'appuie dessus, comme Open WebUI ou AnythingLLM, toutes deux capables de se connecter à l'API d'Ollama.

Sources

← Retour aux LLM locaux avancés