Points clés
- Chroma (trychroma.com) est une base de données d'embeddings gratuite et open source conçue spécifiquement pour les applications d'IA, et non une base de données généraliste reconvertie pour les vecteurs
- Sous licence Apache-2.0, confirmé via le dépôt GitHub
- Plus de 29 300 étoiles GitHub au moment de cette review (vérifié le 2026-09-18)
- Localité : entièrement auto-hébergeable — la base de données open source fonctionne intégralement sur votre propre infrastructure ; Chroma Cloud est une offre managée distincte et optionnelle
- L'API principale se résume à quatre fonctions :
create_collection,add,queryetdelete - Trois modes de déploiement : en mémoire/éphémère (prototypage), stockage local persistant, et architecture client-serveur
- Couramment utilisé comme backend de stockage vectoriel dans les pipelines RAG LangChain et LlamaIndex, associé à des modèles d'embedding locaux via Ollama ou des API d'embedding cloud
📍 En une phrase
Chroma est une base de données vectorielle/d'embeddings gratuite et open source (Apache-2.0), le projet chroma-core/chroma (et non l'outil de design du même nom sans rapport), conçue spécifiquement pour des applications d'IA comme le RAG et la recherche sémantique, et peut être auto-hébergée en mémoire, sur disque local, ou en déploiement client-serveur.
💬 En termes simples
Plutôt que de construire vous-même une couche de stockage pour les « embeddings » numériques qui représentent vos documents, Chroma les stocke pour vous et vous permet de rechercher par sens plutôt que par mots-clés exacts. Il gère automatiquement la tokenisation et l'embedding si vous lui fournissez du texte brut, fonctionne sur votre propre machine ou serveur via pip install chromadb, et est gratuit.
📌Remarque: Cette review est le complément approfondi de la fiche de Chroma dans le Local LLM Software Directory — consultez cette page pour voir en un coup d'œil comment Chroma se compare à des dizaines d'autres outils IA locaux et auto-hébergés.
Qu'est-ce que Chroma ?
Chroma est une base de données d'embeddings open source qui stocke, indexe et recherche les représentations vectorielles de vos textes, images ou autres données, afin que les applications d'IA puissent récupérer l'information par similarité sémantique plutôt que par correspondance exacte de mots-clés. Sa propre description GitHub et le slogan de son site la présentent comme « l'infrastructure de recherche open source pour l'IA » et « l'infrastructure de données open source pour l'IA », construite autour d'une API principale délibérément simple.
- Type de produit : une base de données vectorielle/d'embeddings auto-hébergée, distribuée sous forme de bibliothèque Python et JavaScript, avec un binaire serveur optionnel — pas une application GUI autonome à télécharger
- Dépôt : github.com/chroma-core/chroma
- Licence : Apache-2.0, confirmée via le classificateur de licence du dépôt sur PyPI
- Localité : entièrement auto-hébergeable — la base de données open source de Chroma fonctionne intégralement sur votre propre infrastructure dans tous les modes de déploiement ; Chroma Cloud est une offre managée/serverless distincte et optionnelle pour les équipes qui ne souhaitent pas l'exploiter elles-mêmes
- Échelle : plus de 29 300 étoiles GitHub, et le site de Chroma cite plus de 15 millions de téléchargements mensuels du package
chromadbet une utilisation dans plus de 90 000 bases de code open source — des chiffres qui reflètent l'empreinte de téléchargement globale du package plutôt qu'un décompte nécessairement précis de déploiements de production uniques - Parmi les clients cités sur le propre site de Chroma figurent Capital One, Mintlify, UnitedHealthcare, Conduit, Propel, Cofounder, Weights & Biases et Medwise
Historique du projet Chroma
Chroma est développé comme projet open source sous l'organisation chroma-core sur GitHub, Chroma Cloud ayant été introduit plus tard comme offre managée distincte construite sur la même base de données. Cette review a vérifié directement le nombre actuel d'étoiles GitHub, la licence et les détails des packages à partir du propre dépôt de Chroma et des registres de packages, mais n'a pas pu vérifier le nom d'un fondateur ou d'une société spécifique à partir d'une source primaire et datée lors de la recherche — cette review n'en mentionne donc aucun. Si vous avez besoin de ce détail, consultez directement le site de Chroma et la couverture presse plutôt que de vous fier à une source secondaire.
- L'API principale de Chroma a été conçue autour d'une surface délibérément restreinte :
create_collection,add,queryetdelete, dans le but de mettre rapidement en place un pipeline de récupération fonctionnel - Le projet a atteint plus de 29 300 étoiles GitHub et, selon le propre site de Chroma, plus de 15 millions de téléchargements mensuels du package
chromadbau moment de cette review - Chroma Cloud, une offre managée/serverless distincte, a été introduite comme option pour les équipes souhaitant la même base de données sans l'auto-héberger — le site de Chroma mentionne pour ce palier managé des fonctionnalités comme la conformité SOC 2 Type II, le tiering automatique des données, et le Bring Your Own Cloud (BYOC) pour les entreprises
- La dernière version de
chromadbsur PyPI au moment de cette review est la 1.5.9, publiée le 2026-05-05
Que peut-on faire avec Chroma ?
L'ensemble de fonctionnalités de Chroma se concentre sur le stockage et l'interrogation d'embeddings pour des applications d'IA, selon le propre README GitHub et la documentation de Chroma.
- API principale simple — quatre fonctions couvrent le flux de travail principal :
create_collectionpour définir une collection,addpour insérer des documents,querypour rechercher par similarité, etdeletepour supprimer des entrées - Gestion automatique des embeddings — si vous fournissez à Chroma du texte brut sans apporter vos propres embeddings, il tokenise, embarque (embed) et indexe les documents pour vous à l'aide d'une fonction d'embedding par défaut
- Filtrage par métadonnées — vous pouvez attacher des métadonnées aux documents lors de leur ajout et filtrer les résultats de requête selon ces métadonnées en plus de la similarité sémantique
- Trois modes de déploiement — en mémoire/éphémère pour un prototypage rapide, stockage local persistant pour que les données survivent aux redémarrages, et une architecture client-serveur pour un accès partagé multi-processus
- SDK par langage — clients officiels Python (
chromadbsur PyPI) et JavaScript/TypeScript (chromadbsur npm) - Intégrations frameworks — Chroma est couramment utilisé comme backend de stockage vectoriel dans les pipelines RAG LangChain et LlamaIndex, associé à des modèles d'embedding locaux (par exemple via Ollama) ou à une API d'embedding cloud
- Chroma Cloud (offre distincte) — un palier managé et serverless que le propre site de Chroma décrit comme prenant en charge la recherche vectorielle, plein texte, par regex et par métadonnées, ainsi que la recherche vectorielle creuse (sparse, BM25, SPLADE), le tiering automatique des données, la conformité SOC 2 Type II, et le Bring Your Own Cloud (BYOC) pour les entreprises ; vérifiez la disponibilité actuelle de ces fonctionnalités directement sur trychroma.com, car il s'agit de fonctionnalités du palier managé qui ne sont pas toutes nécessairement présentes dans la base de données open source auto-hébergée
Exemples d'utilisation : trois façons d'utiliser Chroma
Voici des flux de travail concrets construits à partir de l'API documentée de Chroma, exécutés après pip install chromadb.
- Créer un client en mémoire et ajouter/interroger des documents :
chromadb.Client()crée un client éphémère,create_collection()définit une collection nommée,add()insère des documents avec métadonnées et identifiants optionnels, etquery()recherche par similarité sémantique — Chroma tokenise et embarque le texte automatiquement si vous ne fournissez pas vos propres embeddings - Utiliser un client local persistant pour que les données survivent aux redémarrages : l'API documentée de Chroma inclut un mode client persistant (généralement
chromadb.PersistentClient(path=...)dans les versions actuelles) qui écrit les données sur disque local plutôt que de les garder uniquement en mémoire — vérifiez le constructeur exact et ses arguments actuels sur docs.trychroma.com avant de livrer du code qui en dépend, car les API clients peuvent évoluer entre les versions - Associer Chroma à LangChain comme magasin vectoriel dans un pipeline RAG : le flux de travail typique consiste à charger et découper vos documents, à les embarquer avec un modèle d'embedding compatible LangChain (local via Ollama ou un fournisseur cloud), à stocker les vecteurs dans une collection Chroma via l'intégration de magasin vectoriel Chroma de LangChain, puis à interroger ce magasin comme étape de récupération dans une chaîne de récupération — vérifiez la documentation actuelle de LangChain pour le package d'intégration exact et le chemin d'import, car l'intégration Chroma de LangChain a changé de package au fil du temps
import chromadb
client = chromadb.Client()
collection = client.create_collection(name="my_collection")
collection.add(
documents=["This is document1"],
metadatas=[{"source": "notion"}],
ids=["doc1"],
)
results = collection.query(
query_texts=["This is a query document"],
n_results=2,
)Installer Chroma
Chroma s'installe gratuitement via pip ou npm, et son code source est sur GitHub. Il n'existe pas d'installeur GUI autonome, car Chroma est une base de données que vous ajoutez à un projet Python ou JavaScript (avec un composant serveur optionnel pour les déploiements client-serveur).
Source | Link |
|---|---|
| Site officiel (docs, cas d'usage, Chroma Cloud) | trychroma.com |
| Documentation | docs.trychroma.com |
| Dépôt GitHub (code source, Apache-2.0) | github.com/chroma-core/chroma |
| Package PyPI (Python) | pypi.org/project/chromadb |
| Package npm (JavaScript/TypeScript) | npmjs.com/package/chromadb |
Installez avec pip install chromadb (Python) ou npm install chromadb (JavaScript). Aucune clé API ni compte n'est requis pour la base de données open source auto-hébergée — un compte n'est nécessaire que si vous choisissez d'utiliser l'offre distincte Chroma Cloud.
Tarifs Chroma : Chroma est-il vraiment gratuit ?
La base de données open source Chroma est gratuite et sous licence Apache-2.0 — aucun palier payant ne conditionne une fonctionnalité de la base de données auto-hébergée elle-même. Chroma Cloud est une offre managée distincte et optionnelle pour les équipes qui veulent une version serverless et hébergée sans exploiter la base de données elles-mêmes ; au moment de cette review, trychroma.com mentionne un démarrage gratuit sur Chroma Cloud avec un crédit initial gratuit — vérifiez directement trychroma.com pour les conditions actuelles plutôt que de vous fier à un chiffre précis, car les offres du palier managé changent plus souvent que les termes de la licence open source.
- Base de données open source : gratuite, Apache-2.0, sans limite d'usage imposée par Chroma lui-même
- Vos propres coûts se limitent à votre propre infrastructure (calcul et stockage) plus le fournisseur d'embedding que vous utilisez, si vous choisissez une API d'embedding cloud payante plutôt qu'un modèle local
- Chroma Cloud : une offre managée/serverless distincte et optionnelle ; au moment de cette review, le site mentionne un crédit initial gratuit pour les nouveaux comptes — vérifiez les tarifs et conditions de crédit actuels directement sur trychroma.com avant de budgétiser sur un chiffre précis
- Aucun compte ni inscription n'est requis pour installer et utiliser la base de données open source
Chroma vs. Qdrant
Chroma et Qdrant sont deux bases de données vectorielles open source et auto-hébergeables que les développeurs comparent couramment l'une à l'autre pour des backends de RAG et de recherche sémantique, mais elles diffèrent par le langage d'implémentation, les options de déploiement, et l'étendue de leurs capacités de filtrage. Chroma est écrit principalement en Python avec une API principale délibérément restreinte, et est souvent choisi pour sa rapidité à mettre en place un prototype. Qdrant est écrit en Rust, construit autour de capacités de filtrage plus étendues (correspondance de mots-clés, recherche plein texte, plages numériques et conditions de géolocalisation combinées avec des opérateurs logiques sur des payloads JSON), et ajoute un mode léger « Qdrant Edge » pour fonctionner à l'intérieur d'applications sur des appareils en périphérie (edge), en plus de sa propre offre managée Qdrant Cloud.
Écrit en
- Chroma:
- Python (avec un cœur en Rust dans les versions récentes)
- Qdrant:
- Rust
Philosophie de l'API principale
- Chroma:
- Délibérément restreinte : create_collection, add, query, delete
- Qdrant:
- API plus large avec filtrage étendu des payloads (plein texte, plage numérique, géo)
Modes de déploiement
- Chroma:
- En mémoire/éphémère, stockage local persistant, client-serveur
- Qdrant:
- Client-serveur Docker, mode embarqué léger « Edge », Qdrant Cloud managé
Étoiles GitHub (vérifié pour cette review)
- Chroma:
- Plus de 29 300 (vérifié le 2026-09-18)
- Qdrant:
- Plus de 34 700 (vérifié le 2026-09-18)
Licence
- Chroma:
- Apache-2.0
- Qdrant:
- Apache-2.0
Meilleur usage
- Chroma:
- Prototypage rapide et pipelines RAG orientés Python avec une surface d'API minimale
- Qdrant:
- Charges de travail nécessitant un filtrage de métadonnées riche et structuré en plus de la recherche vectorielle, ou une empreinte déployable en périphérie
Les deux projets publient des mises à jour fréquentes et proposent tous deux un palier cloud managé distinct en plus de leur base de données open source — vérifiez la parité de fonctionnalités et les tarifs actuels sur le site de chaque projet avant de choisir, plutôt que de vous fier à une comparaison figée dans le temps.
À qui s'adresse Chroma ?
Que Chroma convienne ou non dépend du fait que vous ayez besoin d'une base de données vectorielle dédiée et auto-hébergeable avec une API minimale, plutôt que d'une couche de mémoire/graphe de connaissances plus large ou d'une base de données axée sur le filtrage.
Concurrents et alternatives
Chroma se situe dans la couche des bases de données vectorielles et de l'infrastructure de récupération, aux côtés de magasins vectoriels embarqués et de frameworks RAG/données plus larges que les développeurs évaluent couramment ensemble. Ce ne sont pas des produits identiques — certains sont des bases de données embarquées plus étroites, d'autres des frameworks d'indexation ou d'orchestration plus larges — mais ils se disputent la même décision : « où stocker et interroger mes embeddings ? »
txtai
- Best known for:
- Base de données vectorielle embarquée légère et bibliothèque de recherche sémantique
- Link:
- Review de txtai
Articles sur txtai (1)
- txtai Review 2026: The Embedded Vector Database That Skips the ServerMis à jour 2 septembre 2026
Également mentionné dans :
- Weaviate Review 2026: The Self-Hostable Vector Database for RAGMis à jour 19 septembre 2026
- Milvus Review 2026: The Open-Source Vector Database for Local RAGMis à jour 18 septembre 2026
- Qdrant Review 2026: The Self-Hosted Vector Database for RAGMis à jour 18 septembre 2026
LlamaIndex
- Best known for:
- Framework de données spécifiquement axé sur l'indexation et la récupération pour les applications LLM
- Link:
- Review de LlamaIndex
Articles sur LlamaIndex (10)
- LlamaIndex Review 2026: Code-First RAG Framework, Not a No-Code BuilderMis à jour 2 septembre 2026
- Chroma Review: Open-Source Vector Database for AI and RAGMis à jour 18 septembre 2026
- Milvus Review 2026: The Open-Source Vector Database for Local RAGMis à jour 18 septembre 2026
- Qdrant Review 2026: The Self-Hosted Vector Database for RAGMis à jour 18 septembre 2026
- Dify Review 2026: Open-Source LLMOps Platform vs. LangChain, FlowiseMis à jour 2 septembre 2026
- Flowise Review 2026: Visual LangChain Workflow Builder Is Shutting DownMis à jour 2 septembre 2026
- Haystack Review 2026: deepset's RAG Framework vs. LangChain and LlamaIndexMis à jour 2 septembre 2026
- RAGFlow Review 2026: Citation-Grade RAG for Complex DocumentsMis à jour 2 septembre 2026
- txtai Review 2026: The Embedded Vector Database That Skips the ServerMis à jour 2 septembre 2026
- Best Local RAG Tools in 2026: Open WebUI, LlamaIndex, and LangChainMis à jour 28 août 2026
+15 autres non affichés
LangChain
- Best known for:
- Framework d'application LLM généraliste avec un large écosystème d'intégrations de récupération et d'agents
- Link:
- Review de LangChain
Articles sur LangChain (10)
- LangChain Review 2026: Features, Pricing, AlternativesMis à jour 5 septembre 2026
- Self-Hosted AI Starter Kit Review 2026: n8n + Ollama + Qdrant in One Compose FileMis à jour 19 septembre 2026
- Chroma Review: Open-Source Vector Database for AI and RAGMis à jour 18 septembre 2026
- cognee Review: Open-Source Knowledge-Graph Memory for AI AgentsMis à jour 18 septembre 2026
- Langchain-Chatchat Review 2026: Self-Hosted RAG and Agent FrameworkMis à jour 18 septembre 2026
- Milvus Review 2026: The Open-Source Vector Database for Local RAGMis à jour 18 septembre 2026
- Qdrant Review 2026: The Self-Hosted Vector Database for RAGMis à jour 18 septembre 2026
- Docker Model Runner Review 2026: Local LLMs via the Docker CLIMis à jour 12 septembre 2026
- n8n Review 2026: AI Workflow Automation With Local Ollama SupportMis à jour 12 septembre 2026
- Agent Zero Review 2026: Features, Install, AlternativesMis à jour 11 septembre 2026
+29 autres non affichés
Haystack (deepset)
- Best known for:
- Framework open source de pipeline RAG et de recherche développé par deepset
- Link:
- Review de Haystack
Cette liste n'est pas exhaustive des bases de données vectorielles et outils de récupération — consultez le Local LLM Software Directory pour le catalogue complet et régulièrement mis à jour, incluant la propre fiche de Chroma dans le répertoire.
Erreurs courantes lors de l'évaluation de Chroma
La plupart des confusions autour de Chroma viennent du fait de le confondre avec l'outil de design du même nom sans rapport, de supposer que les fonctionnalités de Chroma Cloud s'appliquent à la base de données open source, ou de perdre des données en utilisant le mauvais mode client.
Questions fréquemment posées
Qu'est-ce que Chroma ?
Chroma (trychroma.com, code source sur github.com/chroma-core/chroma) est une base de données d'embeddings gratuite et open source (Apache-2.0) — une base de données vectorielle conçue pour des applications d'IA comme la génération augmentée par récupération et la recherche sémantique. Il s'agit du projet chroma-core/chroma, et non de l'outil de design/couleur sans rapport du même nom.
Chroma est-il gratuit ?
Oui, la base de données open source Chroma est gratuite et sous licence Apache-2.0, sans palier payant conditionnant une fonctionnalité de la base de données auto-hébergée. Chroma Cloud est une offre managée distincte et optionnelle avec son propre palier tarifé séparément — consultez trychroma.com pour les tarifs actuels.
Comment installer Chroma ?
Exécutez pip install chromadb pour Python, ou npm install chromadb pour JavaScript/TypeScript. Aucune clé API ni compte n'est requis pour la base de données open source auto-hébergée.
Chroma fonctionne-t-il entièrement hors ligne et en auto-hébergement ?
Oui. La base de données open source Chroma fonctionne entièrement sur votre propre infrastructure dans tous les modes de déploiement — en mémoire, stockage local persistant, ou client-serveur. Chroma Cloud est une offre managée distincte et optionnelle pour les équipes qui préfèrent ne pas s'auto-héberger.
Quels sont les modes de déploiement de Chroma ?
Trois : un mode en mémoire/éphémère pour le prototypage rapide (les données sont perdues à la sortie), un stockage local persistant pour que les données survivent aux redémarrages, et une architecture client-serveur pour un accès partagé multi-processus.
Quelle est l'API principale de Chroma ?
Quatre fonctions couvrent le flux de travail principal : create_collection pour définir une collection, add pour insérer des documents (avec métadonnées et identifiants optionnels), query pour rechercher par similarité sémantique, et delete pour supprimer des entrées.
Chroma gère-t-il les embeddings automatiquement ?
Oui, par défaut. Si vous ajoutez du texte brut sans fournir vos propres embeddings, Chroma tokenise, embarque et indexe les documents pour vous à l'aide d'une fonction d'embedding par défaut ; vous pouvez aussi apporter vos propres embeddings et votre propre modèle d'embedding si vous préférez.
En quoi Chroma diffère-t-il de Qdrant ?
Chroma est écrit principalement en Python avec une API principale délibérément restreinte, et est souvent choisi pour le prototypage rapide. Qdrant est écrit en Rust et construit autour d'un filtrage de métadonnées plus étendu (plages numériques, géolocalisation, plein texte, conditions logiques). Les deux sont sous licence Apache-2.0, auto-hébergeables, et proposent aussi un palier cloud managé distinct — voir la comparaison complète ci-dessus.
Quelle licence utilise Chroma ?
Apache-2.0, confirmée via le classificateur de package sur PyPI et le dépôt GitHub.
Avec quels frameworks Chroma s'intègre-t-il ?
Chroma est couramment utilisé comme backend de magasin vectoriel dans les pipelines RAG LangChain et LlamaIndex, associé soit à un modèle d'embedding local (par exemple via Ollama), soit à une API d'embedding cloud.
Chroma est-il le même produit que l'outil de design/couleur appelé Chroma ?
Non. Cette review couvre chroma-core/chroma, la base de données vectorielle IA open source sur trychroma.com et github.com/chroma-core/chroma. Il existe un produit distinct et sans rapport qui utilise également le nom « Chroma » dans le domaine du design/couleur — vérifiez que vous avez le bon projet avant d'installer quoi que ce soit.
Qu'est-ce que Chroma Cloud ?
Chroma Cloud est une offre managée/serverless distincte et optionnelle, construite sur la même base de données, pour les équipes qui ne souhaitent pas s'auto-héberger. Le propre site de Chroma mentionne pour ce palier des fonctionnalités comme la conformité SOC 2 Type II et le Bring Your Own Cloud (BYOC) — vérifiez les fonctionnalités et tarifs actuels directement sur trychroma.com.