Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Chroma Review: Open-Source-Vektordatenbank für KI und RAG
RAG & Document Chat

Chroma Review: Open-Source-Vektordatenbank für KI und RAG

·10 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Chroma ist eine kostenlose, quelloffene (Apache-2.0) Embedding-Datenbank — eine Vektordatenbank, die speziell für KI-Anwendungen wie Retrieval-Augmented Generation und semantische Suche entwickelt wurde. Sie wird mit pip install chromadb (Python) oder npm install chromadb (JavaScript) installiert, läuft vollständig auf Ihrer eigenen Infrastruktur im ephemeren, persistent-lokalen oder Client-Server-Modus, und übernimmt standardmäßig Tokenisierung, Einbettung und Indexierung von Dokumenten für Sie. Chroma Cloud ist ein separates, optionales verwaltetes Angebot für Teams, die nicht selbst hosten möchten.

Chroma (trychroma.com, Quellcode unter github.com/chroma-core/chroma) ist eine kostenlose, quelloffene (Apache-2.0) Embedding-Datenbank — eine Vektordatenbank, die speziell für KI-Anwendungen wie Retrieval-Augmented Generation (RAG) und semantische Suche entwickelt wurde. Diese Review behandelt konkret das Projekt chroma-core/chroma, nicht das gleichnamige, aber unabhängige Design-/Farbwerkzeug. Chroma hat über 29.300 GitHub-Stars, lässt sich vollständig auf eigener Infrastruktur betreiben und wird häufig mit Frameworks wie LangChain und LlamaIndex kombiniert. Diese Review beschreibt, was Chroma tatsächlich tut, wie man es installiert und nutzt, wie es sich mit Qdrant vergleicht, und für wen es geeignet ist.

Wichtigste Erkenntnisse

  • Chroma (trychroma.com) ist eine kostenlose, quelloffene Embedding-Datenbank, speziell für KI-Anwendungen gebaut, keine für Vektoren umfunktionierte Allzweckdatenbank
  • Unter Apache-2.0 lizenziert, bestätigt über das GitHub-Repository
  • Über 29.300 GitHub-Stars zum Zeitpunkt dieser Review (verifiziert 2026-09-18)
  • Lokalität: vollständig selbst hostbar — die quelloffene Datenbank läuft komplett auf Ihrer eigenen Infrastruktur; Chroma Cloud ist ein separates, optionales verwaltetes Angebot
  • Die Kern-API besteht aus vier Funktionen: create_collection, add, query und delete
  • Drei Bereitstellungsmodi: ephemer im Arbeitsspeicher (Prototyping), persistenter lokaler Speicher und Client-Server-Architektur
  • Wird häufig als Vektorspeicher-Backend in LangChain- und LlamaIndex-RAG-Pipelines eingesetzt, kombiniert mit lokalen Embedding-Modellen über Ollama oder Cloud-Embedding-APIs

📍 In einem Satz

Chroma ist eine kostenlose, quelloffene (Apache-2.0) Vektor-/Embedding-Datenbank — das Projekt chroma-core/chroma (nicht das gleichnamige, unabhängige Design-Tool), speziell für KI-Anwendungen wie RAG und semantische Suche gebaut, und lässt sich im Arbeitsspeicher, auf lokaler Festplatte oder als Client-Server-Bereitstellung selbst hosten.

💬 In einfachen Worten

Statt selbst eine Speicherschicht für die numerischen „Embeddings" zu bauen, die Ihre Dokumente repräsentieren, speichert Chroma diese für Sie und lässt Sie nach Bedeutung statt nach exakten Schlüsselwörtern suchen. Es übernimmt das Tokenisieren und Einbetten automatisch, wenn Sie rohen Text einspeisen, läuft auf Ihrem eigenen Rechner oder Server über pip install chromadb, und ist kostenlos.

📌Hinweis: Diese Review ist der Deep-Dive-Begleiter zu Chromas Eintrag im Local LLM Software Directory — dort finden Sie, wie sich Chroma im Vergleich zu Dutzenden anderer lokaler und selbst gehosteter KI-Tools auf einen Blick schlägt.

Was ist Chroma?

Chroma ist eine quelloffene Embedding-Datenbank, die die Vektorrepräsentationen Ihrer Texte, Bilder oder anderer Daten speichert, indexiert und durchsucht, sodass KI-Anwendungen Informationen anhand semantischer Ähnlichkeit statt exakter Schlüsselwortübereinstimmung abrufen können. Die eigene GitHub-Beschreibung und der Website-Slogan positionieren Chroma als „quelloffene Suchinfrastruktur für KI" und „die quelloffene Dateninfrastruktur für KI", aufgebaut um eine bewusst schlanke Kern-API.

  • Produkttyp: eine selbst gehostete Vektor-/Embedding-Datenbank, verteilt als Python- und JavaScript-Bibliothek plus optionaler Server-Binärdatei — keine eigenständige, herunterladbare GUI-App
  • Repository: github.com/chroma-core/chroma
  • Lizenz: Apache-2.0, bestätigt über den Lizenz-Klassifikator auf PyPI
  • Lokalität: vollständig selbst hostbar — Chromas quelloffene Datenbank läuft in jedem Bereitstellungsmodus komplett auf Ihrer eigenen Infrastruktur; Chroma Cloud ist ein separates, optionales verwaltetes/serverloses Angebot für Teams, die es nicht selbst betreiben möchten
  • Umfang: über 29.300 GitHub-Stars, und Chromas eigene Website nennt mehr als 15 Millionen monatliche Downloads des Pakets chromadb und Nutzung in über 90.000 Open-Source-Codebasen — Zahlen, die eher den breiten Download- und Referenz-Fußabdruck des Pakets widerspiegeln als zwingend die Anzahl eindeutiger Produktionsnutzer
  • Auf Chromas eigener Website genannte Kunden umfassen Capital One, Mintlify, UnitedHealthcare, Conduit, Propel, Cofounder, Weights & Biases und Medwise

Projektgeschichte von Chroma

Chroma wird als quelloffenes Projekt unter der Organisation chroma-core auf GitHub entwickelt, wobei Chroma Cloud später als separates verwaltetes Angebot auf derselben Datenbank eingeführt wurde. Diese Review hat die aktuelle GitHub-Star-Anzahl, die Lizenz und die Paketdetails direkt über Chromas eigenes Repository und die Paketregister verifiziert, konnte während der Recherche jedoch keinen konkreten Gründer- oder Firmennamen aus einer primären, datierten Quelle verifizieren — deshalb nennt diese Review keinen. Falls Sie dieses Detail benötigen, prüfen Sie Chromas eigene Website und Presseberichte direkt, statt sich auf eine Sekundärquelle zu verlassen.

  • Chromas Kern-API wurde um eine bewusst kleine Oberfläche herum aufgebaut: create_collection, add, query und delete, mit dem Ziel, schnell eine funktionierende Retrieval-Pipeline zum Laufen zu bringen
  • Das Projekt ist auf über 29.300 GitHub-Stars gewachsen und verzeichnet laut Chromas eigener Website zum Zeitpunkt dieser Review mehr als 15 Millionen monatliche Downloads des Pakets chromadb
  • Chroma Cloud, ein separates verwaltetes/serverloses Angebot, wurde als optionaler Weg für Teams eingeführt, die dieselbe Datenbank nutzen möchten, ohne sie selbst zu hosten — Chromas Website nennt für diese verwaltete Stufe Funktionen wie SOC-2-Typ-II-Konformität, automatische Daten-Tiering und Bring Your Own Cloud (BYOC) für Unternehmen
  • Die aktuellste chromadb-Version auf PyPI zum Zeitpunkt dieser Review ist 1.5.9, veröffentlicht am 2026-05-05

Was kann man mit Chroma tun?

Chromas Funktionsumfang dreht sich um das Speichern und Abfragen von Embeddings für KI-Anwendungen, laut Chromas eigenem GitHub-README und Dokumentation.

  • Einfache Kern-API — vier Funktionen decken den Kern-Workflow ab: create_collection zum Definieren einer Sammlung, add zum Einfügen von Dokumenten, query zur Ähnlichkeitssuche und delete zum Entfernen von Einträgen
  • Automatische Embedding-Verarbeitung — wenn Sie Chroma rohen Text ohne eigene Embeddings zuführen, tokenisiert, embedded und indexiert es die Dokumente für Sie mithilfe einer Standard-Embedding-Funktion
  • Metadatenfilterung — Sie können Dokumenten beim Hinzufügen Metadaten anhängen und Abfrageergebnisse neben der semantischen Ähnlichkeit auch nach diesen Metadaten filtern
  • Drei Bereitstellungsmodi — ephemer im Arbeitsspeicher für schnelles Prototyping, persistenter lokaler Speicher, damit Daten Neustarts überstehen, und eine Client-Server-Architektur für gemeinsamen Multi-Prozess-Zugriff
  • Sprach-SDKs — offizielle Python- (chromadb auf PyPI) und JavaScript/TypeScript-Clients (chromadb auf npm)
  • Framework-Integrationen — Chroma wird häufig als Vektorspeicher-Backend in LangChain- und LlamaIndex-RAG-Pipelines eingesetzt, kombiniert mit lokalen Embedding-Modellen (zum Beispiel über Ollama) oder einer Cloud-Embedding-API
  • Chroma Cloud (separates Angebot) — eine verwaltete, serverlose Stufe, die Chromas eigene Website als Unterstützung von Vektor-, Volltext-, Regex- und Metadatensuche beschreibt, plus Sparse-Vektorsuche (BM25, SPLADE), automatisches Daten-Tiering, SOC-2-Typ-II-Konformität und Bring Your Own Cloud (BYOC) für Unternehmen; prüfen Sie die aktuelle Funktionsverfügbarkeit direkt auf trychroma.com, da dies Funktionen der verwalteten Stufe sind und nicht alle davon zwingend in der selbst gehosteten quelloffenen Datenbank enthalten sind

Anwendungsbeispiele: Drei Wege, Chroma zu nutzen

Dies sind konkrete Workflows, die auf Chromas dokumentierter API aufbauen und nach pip install chromadb ausgeführt werden.

  • Einen In-Memory-Client erstellen und Dokumente hinzufügen und abfragen: chromadb.Client() erstellt einen ephemeren Client, create_collection() definiert eine benannte Sammlung, add() fügt Dokumente mit optionalen Metadaten und IDs ein, und query() sucht nach semantischer Ähnlichkeit — Chroma tokenisiert und embedded den Text automatisch, falls Sie keine eigenen Embeddings übergeben
  • Einen persistenten lokalen Client verwenden, damit Daten Neustarts überstehen: Chromas dokumentierte API umfasst einen persistenten Client-Modus (in aktuellen Releases üblicherweise chromadb.PersistentClient(path=...)), der Daten auf die lokale Festplatte statt nur in den Arbeitsspeicher schreibt — prüfen Sie den genauen aktuellen Konstruktor und dessen Argumente gegen docs.trychroma.com, bevor Sie Code ausliefern, der davon abhängt, da sich Client-APIs zwischen Releases ändern können
  • Chroma mit LangChain als Vektorspeicher in einer RAG-Pipeline kombinieren: der typische Workflow besteht darin, Ihre Dokumente zu laden und aufzuteilen, sie mit einem LangChain-kompatiblen Embedding-Modell einzubetten (lokal über Ollama oder einen Cloud-Anbieter), die Vektoren über LangChains Chroma-Vektorspeicher-Integration in einer Chroma-Sammlung zu speichern und diesen Speicher dann als Retriever-Schritt in einer Retrieval-Kette abzufragen — prüfen Sie LangChains aktuelle Dokumentation für das genaue Integrationspaket und den Importpfad, da sich LangChains Chroma-Integration im Laufe der Zeit zwischen Paketen verschoben hat
python
import chromadb

client = chromadb.Client()
collection = client.create_collection(name="my_collection")

collection.add(
    documents=["This is document1"],
    metadatas=[{"source": "notion"}],
    ids=["doc1"],
)

results = collection.query(
    query_texts=["This is a query document"],
    n_results=2,
)

Chroma Preise: Ist Chroma wirklich kostenlos?

Die quelloffene Chroma-Datenbank ist kostenlos und unter Apache-2.0 lizenziert — es gibt keine kostenpflichtige Stufe, die eine Funktion der selbst gehosteten Datenbank selbst einschränkt. Chroma Cloud ist ein separates, optionales verwaltetes Angebot für Teams, die eine serverlose, gehostete Version wollen, ohne die Datenbank selbst zu betreiben; zum Zeitpunkt dieser Review verweist trychroma.com auf einen kostenlosen Einstieg bei Chroma Cloud mit einem anfänglichen Freikontingent — prüfen Sie trychroma.com direkt für aktuelle Konditionen, statt eine bestimmte Zahl anzunehmen, da sich Angebote der verwalteten Stufe häufiger ändern als Open-Source-Lizenzbedingungen.

  • Quelloffene Datenbank: kostenlos, Apache-2.0, keine von Chroma selbst auferlegten Nutzungsgrenzen
  • Ihre eigenen Kosten beschränken sich auf Ihre eigene Infrastruktur (Rechenleistung und Speicher) sowie den von Ihnen genutzten Embedding-Anbieter, falls Sie sich für eine kostenpflichtige Cloud-Embedding-API statt eines lokalen Modells entscheiden
  • Chroma Cloud: ein separates, optionales verwaltetes/serverloses Angebot; zum Zeitpunkt dieser Review nennt die Website ein anfängliches Freikontingent für neue Konten — prüfen Sie aktuelle Preise und Kontingentbedingungen direkt auf trychroma.com, bevor Sie mit einer bestimmten Zahl planen
  • Für die Installation und Nutzung der quelloffenen Datenbank ist kein Konto oder keine Anmeldung erforderlich

Chroma vs. Qdrant

Chroma und Qdrant sind beide quelloffene, selbst hostbare Vektordatenbanken, die Entwickler häufig gegeneinander für RAG- und semantische-Suche-Backends abwägen, sich aber in Implementierungssprache, Bereitstellungsoptionen und dem Umfang ihrer Filterfunktionen unterscheiden. Chroma ist primär in Python geschrieben, mit einer bewusst kleinen Kern-API, und wird oft gewählt, weil es schnell einen Prototyp zum Laufen bringt. Qdrant ist in Rust geschrieben, um umfangreichere Filterfunktionen herum aufgebaut (Schlüsselwortabgleich, Volltextsuche, numerische Bereiche und Geolokations-Bedingungen kombiniert mit logischen Operatoren über JSON-Payloads) und ergänzt einen leichtgewichtigen „Qdrant Edge"-Modus für den Betrieb innerhalb von Anwendungen auf Edge-Geräten, zusätzlich zum eigenen verwalteten Qdrant-Cloud-Angebot.

Geschrieben in

Chroma:
Python (mit Rust-gestütztem Kern in neueren Releases)
Qdrant:
Rust

Philosophie der Kern-API

Chroma:
Bewusst klein: create_collection, add, query, delete
Qdrant:
Breitere API mit umfangreicher Payload-Filterung (Volltext, numerischer Bereich, Geo)

Bereitstellungsmodi

Chroma:
Im Arbeitsspeicher/ephemer, persistenter lokaler Speicher, Client-Server
Qdrant:
Docker-Client-Server, leichtgewichtiger eingebetteter „Edge"-Modus, verwaltete Qdrant Cloud

GitHub-Stars (für diese Review verifiziert)

Chroma:
Über 29.300 (verifiziert 2026-09-18)
Qdrant:
Über 34.700 (verifiziert 2026-09-18)

Lizenz

Chroma:
Apache-2.0
Qdrant:
Apache-2.0

Beste Eignung

Chroma:
Schnelles Prototyping und Python-first-RAG-Pipelines mit minimaler API-Oberfläche
Qdrant:
Workloads, die neben der Vektorsuche reichhaltige, strukturierte Metadatenfilterung oder einen edge-fähigen Fußabdruck benötigen

Beide Projekte liefern häufig Updates und bieten beide neben ihrer quelloffenen Datenbank eine separate verwaltete Cloud-Stufe an — prüfen Sie die aktuelle Funktionsparität und Preise auf der jeweiligen Projektwebsite, statt sich auf einen Momentaufnahme-Vergleich zu verlassen.

Für wen eignet sich Chroma?

Ob Chroma passt, hängt davon ab, ob Sie eine dedizierte, selbst hostbare Vektordatenbank mit minimaler API benötigen, statt einer breiteren Gedächtnis-/Wissensgraph-Schicht oder einer filterlastigen Datenbank.

Wettbewerber und Alternativen

Chroma bewegt sich in der Schicht der Vektordatenbanken und Retrieval-Infrastruktur, neben eingebetteten Vektorspeichern und breiteren RAG-/Daten-Frameworks, die Entwickler häufig gemeinsam bewerten. Dies sind keine identischen Produkte — manche sind schmalere eingebettete Datenbanken, andere breitere Indexierungs- oder Orchestrierungs-Frameworks — aber sie konkurrieren um dieselbe Entscheidung: „Wo speichere und befrage ich meine Embeddings?"

txtai

Best known for:
Leichtgewichtige eingebettete Vektordatenbank und semantische Suchbibliothek
Artikel über txtai (1)

Auch erwähnt in:

LlamaIndex

Best known for:
Daten-Framework, das speziell auf Indexierung und Retrieval für LLM-Anwendungen fokussiert ist
Artikel über LlamaIndex (10)

+15 weitere nicht angezeigt

LangChain

Best known for:
Allzweck-LLM-Anwendungs-Framework mit großem Ökosystem an Retrieval- und Agenten-Integrationen
Artikel über LangChain (10)

+29 weitere nicht angezeigt

Haystack (deepset)

Best known for:
Quelloffenes RAG- und Suchpipeline-Framework von deepset

Dies ist keine erschöpfende Liste von Vektordatenbanken und Retrieval-Tools — siehe das Local LLM Software Directory für den vollständigen, regelmäßig aktualisierten Katalog, einschließlich Chromas eigenem Directory-Eintrag.

Häufige Fehler bei der Bewertung von Chroma

Die meiste Verwirrung um Chroma entsteht durch Verwechslung mit dem gleichnamigen, unabhängigen Design-Tool, durch die Annahme, Chroma-Cloud-Funktionen gälten auch für die quelloffene Datenbank, oder durch Datenverlust wegen des falschen Client-Modus.

Häufig gestellte Fragen

Was ist Chroma?

Chroma (trychroma.com, Quellcode unter github.com/chroma-core/chroma) ist eine kostenlose, quelloffene (Apache-2.0) Embedding-Datenbank — eine Vektordatenbank für KI-Anwendungen wie Retrieval-Augmented Generation und semantische Suche. Dies ist das Projekt chroma-core/chroma, nicht das gleichnamige, unabhängige Design-/Farb-Tool.

Ist Chroma kostenlos?

Ja, die quelloffene Chroma-Datenbank ist kostenlos und unter Apache-2.0 lizenziert, ohne kostenpflichtige Stufe, die eine Funktion der selbst gehosteten Datenbank einschränkt. Chroma Cloud ist ein separates, optionales verwaltetes Angebot mit eigener, separat bepreister Stufe — aktuelle Preise auf trychroma.com prüfen.

Wie installiere ich Chroma?

Führen Sie pip install chromadb für Python oder npm install chromadb für JavaScript/TypeScript aus. Für die selbst gehostete, quelloffene Datenbank sind kein API-Schlüssel und kein Konto erforderlich.

Läuft Chroma vollständig offline und selbst gehostet?

Ja. Die quelloffene Chroma-Datenbank läuft in jedem Bereitstellungsmodus — im Arbeitsspeicher, auf persistentem lokalem Speicher oder als Client-Server — vollständig auf Ihrer eigenen Infrastruktur. Chroma Cloud ist ein separates, optionales verwaltetes Angebot für Teams, die lieber nicht selbst hosten möchten.

Welche Bereitstellungsmodi hat Chroma?

Drei: ein ephemerer Modus im Arbeitsspeicher für schnelles Prototyping (Daten gehen beim Beenden verloren), persistenter lokaler Speicher, damit Daten Neustarts überstehen, und eine Client-Server-Architektur für gemeinsamen Multi-Prozess-Zugriff.

Was ist die Kern-API von Chroma?

Vier Funktionen decken den Kern-Workflow ab: create_collection zum Definieren einer Sammlung, add zum Einfügen von Dokumenten (mit optionalen Metadaten und IDs), query zur semantischen Ähnlichkeitssuche und delete zum Entfernen von Einträgen.

Übernimmt Chroma Embeddings automatisch?

Ja, standardmäßig. Wenn Sie rohen Text hinzufügen, ohne eigene Embeddings bereitzustellen, tokenisiert, embedded und indexiert Chroma die Dokumente mithilfe einer Standard-Embedding-Funktion für Sie; Sie können auch eigene Embeddings und ein eigenes Embedding-Modell mitbringen, falls gewünscht.

Wie unterscheidet sich Chroma von Qdrant?

Chroma ist primär in Python geschrieben, mit bewusst kleiner Kern-API, und wird oft für schnelles Prototyping gewählt. Qdrant ist in Rust geschrieben und um umfangreichere Metadatenfilterung herum aufgebaut (numerische Bereiche, Geolokation, Volltext, logische Bedingungen). Beide sind Apache-2.0-lizenziert, selbst hostbar und bieten zusätzlich eine separate verwaltete Cloud-Stufe — siehe den vollständigen Vergleich oben.

Welche Lizenz nutzt Chroma?

Apache-2.0, bestätigt über den Paket-Klassifikator auf PyPI und das GitHub-Repository.

Mit welchen Frameworks integriert sich Chroma?

Chroma wird häufig als Vektorspeicher-Backend in LangChain- und LlamaIndex-RAG-Pipelines eingesetzt, kombiniert entweder mit einem lokalen Embedding-Modell (zum Beispiel über Ollama) oder einer Cloud-Embedding-API.

Ist Chroma dasselbe wie das Design-/Farb-Tool namens Chroma?

Nein. Diese Review behandelt chroma-core/chroma, die quelloffene KI-Vektordatenbank unter trychroma.com und github.com/chroma-core/chroma. Es gibt ein separates, unabhängiges Produkt, das ebenfalls den Namen „Chroma" im Design-/Farb-Tool-Bereich verwendet — vergewissern Sie sich, dass Sie das richtige Projekt haben, bevor Sie etwas installieren.

Was ist Chroma Cloud?

Chroma Cloud ist ein separates, optionales verwaltetes/serverloses Angebot, aufgebaut auf derselben Datenbank, für Teams, die nicht selbst hosten möchten. Chromas eigene Website nennt für diese Stufe Funktionen wie SOC-2-Typ-II-Konformität und Bring Your Own Cloud (BYOC) — aktuelle Funktionen und Preise direkt auf trychroma.com prüfen.

Quellen

← Zurück zu Lokale LLMs Pro