Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Chroma Review: base de datos de vectores de código abierto para IA y RAG
RAG & Document Chat

Chroma Review: base de datos de vectores de código abierto para IA y RAG

·10 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Chroma es una base de datos de embeddings gratuita y de código abierto (Apache-2.0) — una base de datos de vectores creada específicamente para aplicaciones de IA como la generación aumentada por recuperación y la búsqueda semántica. Se instala con pip install chromadb (Python) o npm install chromadb (JavaScript), se ejecuta por completo en tu propia infraestructura en modo efímero, local persistente o cliente-servidor, y de forma predeterminada se encarga de la tokenización, el embedding y la indexación de documentos por ti. Chroma Cloud es una oferta gestionada aparte y opcional para equipos que no quieren autoalojarlo.

Chroma (trychroma.com, código fuente en github.com/chroma-core/chroma) es una base de datos de embeddings gratuita y de código abierto (Apache-2.0) — una base de datos de vectores creada específicamente para aplicaciones de IA como la generación aumentada por recuperación (RAG) y la búsqueda semántica. Esta review cubre concretamente el proyecto chroma-core/chroma, no la herramienta de diseño/color homónima y no relacionada. Chroma tiene más de 29.300 estrellas en GitHub, puede ejecutarse por completo en tu propia infraestructura y suele combinarse con frameworks como LangChain y LlamaIndex. Esta review explica qué hace realmente Chroma, cómo instalarlo y usarlo, cómo se compara con Qdrant y para quién es adecuado.

Conclusiones clave

  • Chroma (trychroma.com) es una base de datos de embeddings gratuita y de código abierto creada específicamente para aplicaciones de IA, no una base de datos de propósito general readaptada para vectores
  • Con licencia Apache-2.0, confirmado a través del repositorio de GitHub
  • Más de 29.300 estrellas en GitHub en el momento de esta review (verificado el 18-09-2026)
  • Localidad: totalmente autoalojable — la base de datos de código abierto se ejecuta por completo en tu propia infraestructura; Chroma Cloud es una oferta gestionada aparte y opcional
  • La API principal consta de cuatro funciones: create_collection, add, query y delete
  • Tres modos de despliegue: en memoria/efímero (prototipado), almacenamiento local persistente y arquitectura cliente-servidor
  • Se usa habitualmente como backend de almacén de vectores dentro de pipelines RAG de LangChain y LlamaIndex, combinado con modelos de embedding locales vía Ollama o APIs de embedding en la nube

📍 En una frase

Chroma es una base de datos de vectores/embeddings gratuita y de código abierto (Apache-2.0), el proyecto chroma-core/chroma (no la herramienta de diseño homónima y no relacionada), creada específicamente para aplicaciones de IA como RAG y búsqueda semántica, y se puede autoalojar en memoria, en disco local o como despliegue cliente-servidor.

💬 En términos simples

En lugar de construir tu propia capa de almacenamiento para los "embeddings" numéricos que representan tus documentos, Chroma los guarda por ti y te permite buscar por significado en lugar de por palabras clave exactas. Gestiona la tokenización y el embedding automáticamente si le das texto plano, se ejecuta en tu propia máquina o servidor con pip install chromadb, y es gratis.

📌Nota: Esta review es el complemento en profundidad de la entrada de Chroma en el Directorio de Software LLM Local — consulta esa página para ver de un vistazo cómo se compara Chroma con decenas de otras herramientas de IA locales y autoalojadas.

¿Qué es Chroma?

Chroma es una base de datos de embeddings de código abierto que almacena, indexa y busca las representaciones vectoriales de tu texto, imágenes u otros datos, de modo que las aplicaciones de IA puedan recuperar información por similitud semántica en lugar de por coincidencia exacta de palabras clave. Su propia descripción en GitHub y el eslogan de su sitio la posicionan como "infraestructura de búsqueda de código abierto para IA" y "la infraestructura de datos de código abierto para IA", construida en torno a una API principal deliberadamente sencilla.

  • Tipo de producto: una base de datos de vectores/embeddings autoalojada, distribuida como biblioteca de Python y JavaScript más un binario de servidor opcional — no una aplicación de escritorio con GUI independiente
  • Repositorio: github.com/chroma-core/chroma
  • Licencia: Apache-2.0, confirmada a través del clasificador de licencia del repositorio en PyPI
  • Localidad: totalmente autoalojable — la base de datos de código abierto de Chroma se ejecuta por completo en tu propia infraestructura en todos los modos de despliegue; Chroma Cloud es una oferta gestionada/serverless aparte y opcional para equipos que no quieren operarla ellos mismos
  • Escala: más de 29.300 estrellas en GitHub, y el propio sitio de Chroma cita más de 15 millones de descargas mensuales del paquete chromadb y uso en más de 90.000 bases de código de código abierto — cifras que reflejan la huella de descargas del paquete más que necesariamente un recuento de despliegues de producción únicos
  • Entre los clientes nombrados en el propio sitio de Chroma están Capital One, Mintlify, UnitedHealthcare, Conduit, Propel, Cofounder, Weights & Biases y Medwise

Historia del proyecto Chroma

Chroma se desarrolla como proyecto de código abierto bajo la organización chroma-core en GitHub, y Chroma Cloud se introdujo más tarde como oferta gestionada aparte, construida sobre la misma base de datos. Esta review verificó el número actual de estrellas en GitHub, la licencia y los detalles del paquete directamente en el repositorio y los registros de paquetes de Chroma, pero no pudo verificar un nombre concreto de fundador o empresa a partir de una fuente primaria y fechada durante la investigación — por eso esta review no indica ninguno. Si necesitas ese detalle, consulta directamente el propio sitio de Chroma y la cobertura de prensa en lugar de basarte en una fuente secundaria.

  • La API principal de Chroma se construyó en torno a una superficie deliberadamente pequeña: create_collection, add, query y delete, con el objetivo de poner en marcha rápidamente un pipeline de recuperación funcional
  • El proyecto ha crecido hasta superar las 29.300 estrellas en GitHub y, según el propio sitio de Chroma, más de 15 millones de descargas mensuales del paquete chromadb en el momento de esta review
  • Chroma Cloud, una oferta gestionada/serverless aparte, se introdujo como vía opcional para equipos que quieren la misma base de datos sin autoalojarla — el sitio de Chroma menciona funciones como el cumplimiento SOC 2 Tipo II, el escalonamiento automático de datos (data tiering) y Bring Your Own Cloud (BYOC) para empresas en ese nivel gestionado
  • La última versión de chromadb en PyPI en el momento de esta review es la 1.5.9, publicada el 05-05-2026

¿Qué puedes hacer con Chroma?

El conjunto de funciones de Chroma se centra en almacenar y consultar embeddings para aplicaciones de IA, según el propio README de GitHub y la documentación de Chroma.

  • API principal sencilla — cuatro funciones cubren el flujo de trabajo principal: create_collection para definir una colección, add para insertar documentos, query para buscar por similitud y delete para eliminar entradas
  • Gestión automática de embeddings — si le das a Chroma texto plano sin aportar tus propios embeddings, tokeniza, embebe e indexa los documentos por ti usando una función de embedding predeterminada
  • Filtrado por metadatos — puedes asociar metadatos a los documentos al añadirlos y filtrar los resultados de las consultas por esos metadatos junto con la similitud semántica
  • Tres modos de despliegue — en memoria/efímero para prototipado rápido, almacenamiento local persistente para que los datos sobrevivan a los reinicios del proceso, y una arquitectura cliente-servidor para acceso compartido multiproceso
  • SDKs de lenguaje — clientes oficiales de Python (chromadb en PyPI) y JavaScript/TypeScript (chromadb en npm)
  • Integraciones con frameworks — Chroma se usa habitualmente como backend de almacén de vectores dentro de pipelines RAG de LangChain y LlamaIndex, combinado con modelos de embedding locales (por ejemplo vía Ollama) o una API de embedding en la nube
  • Chroma Cloud (oferta aparte) — un nivel gestionado y serverless que el propio sitio de Chroma describe como compatible con búsqueda vectorial, de texto completo, por expresiones regulares y por metadatos, además de búsqueda vectorial dispersa (BM25, SPLADE), escalonamiento automático de datos, cumplimiento SOC 2 Tipo II y Bring Your Own Cloud (BYOC) para empresas; verifica la disponibilidad actual de funciones directamente en trychroma.com, ya que son funciones del nivel gestionado y no todas están necesariamente presentes en la base de datos de código abierto autoalojada

Ejemplos de uso: tres formas de usar Chroma

Estos son flujos de trabajo concretos basados en la API documentada de Chroma, ejecutados tras pip install chromadb.

  • Crear un cliente en memoria y añadir y consultar documentos: chromadb.Client() crea un cliente efímero, create_collection() define una colección con nombre, add() inserta documentos con metadatos e IDs opcionales, y query() busca por similitud semántica — Chroma tokeniza y embebe el texto automáticamente si no le pasas tus propios embeddings
  • Usar un cliente local persistente para que los datos sobrevivan a los reinicios: la API documentada de Chroma incluye un modo de cliente persistente (habitualmente chromadb.PersistentClient(path=...) en las versiones actuales) que escribe los datos en disco local en lugar de mantenerlos solo en memoria — verifica el constructor y los argumentos exactos actuales en docs.trychroma.com antes de publicar código que dependa de ello, ya que las APIs del cliente pueden cambiar entre versiones
  • Combinar Chroma con LangChain como almacén de vectores en un pipeline RAG: el flujo de trabajo típico es cargar y dividir tus documentos, embeberlos con un modelo de embedding compatible con LangChain (local vía Ollama o un proveedor en la nube), almacenar los vectores en una colección de Chroma a través de la integración de almacén de vectores Chroma de LangChain, y luego consultar ese almacén como paso de recuperación en una cadena de recuperación — consulta la documentación actual de LangChain para conocer el paquete de integración y la ruta de importación exactos, ya que la integración de Chroma en LangChain se ha movido entre paquetes con el tiempo
python
import chromadb

client = chromadb.Client()
collection = client.create_collection(name="my_collection")

collection.add(
    documents=["This is document1"],
    metadatas=[{"source": "notion"}],
    ids=["doc1"],
)

results = collection.query(
    query_texts=["This is a query document"],
    n_results=2,
)

Precios de Chroma: ¿es realmente gratis?

La base de datos de código abierto de Chroma es gratuita y tiene licencia Apache-2.0 — no hay ningún nivel de pago que limite ninguna función de la base de datos autoalojada en sí. Chroma Cloud es una oferta gestionada aparte y opcional para equipos que quieren una versión serverless y alojada sin operar ellos mismos la base de datos; en el momento de esta review, trychroma.com menciona un inicio gratuito en Chroma Cloud con una asignación inicial de crédito gratuito — consulta trychroma.com directamente para conocer las condiciones actuales en lugar de asumir una cifra concreta, ya que las ofertas del nivel gestionado cambian con más frecuencia que las condiciones de la licencia de código abierto.

  • Base de datos de código abierto: gratuita, Apache-2.0, sin límites de uso impuestos por Chroma
  • Tus propios costes se limitan a tu propia infraestructura (cómputo y almacenamiento) más el proveedor de embeddings que uses, si eliges una API de embedding en la nube de pago en lugar de un modelo local
  • Chroma Cloud: una oferta gestionada/serverless aparte y opcional; en el momento de esta review el sitio menciona una asignación inicial de crédito gratuito para cuentas nuevas, pero verifica los precios y las condiciones del crédito actuales directamente en trychroma.com antes de presupuestar en torno a una cifra concreta
  • No se requiere cuenta ni registro para instalar y usar la base de datos de código abierto

Chroma vs. Qdrant

Chroma y Qdrant son bases de datos de vectores de código abierto y autoalojables que los desarrolladores suelen comparar entre sí para backends de RAG y búsqueda semántica, pero difieren en el lenguaje de implementación, las opciones de despliegue y hasta dónde llegan sus capacidades de filtrado. Chroma está escrito principalmente en Python, con una API principal deliberadamente pequeña, y suele elegirse por lo rápido que permite poner en marcha un prototipo. Qdrant está escrito en Rust, se construye en torno a capacidades de filtrado más extensas (coincidencia de palabras clave, búsqueda de texto completo, rangos numéricos y condiciones de geolocalización combinadas con operadores lógicos sobre payloads JSON), y añade un modo ligero "Qdrant Edge" para ejecutarse dentro de aplicaciones en dispositivos edge, además de su propia oferta gestionada Qdrant Cloud.

Escrito en

Chroma:
Python (con un núcleo respaldado por Rust en versiones recientes)
Qdrant:
Rust

Filosofía de la API principal

Chroma:
Deliberadamente pequeña: create_collection, add, query, delete
Qdrant:
API más amplia con filtrado extenso de payload (texto completo, rango numérico, geo)

Modos de despliegue

Chroma:
En memoria/efímero, almacenamiento local persistente, cliente-servidor
Qdrant:
Cliente-servidor con Docker, modo integrado ligero "Edge", Qdrant Cloud gestionado

Estrellas en GitHub (verificadas para esta review)

Chroma:
Más de 29.300 (verificado 18-09-2026)
Qdrant:
Más de 34.700 (verificado 18-09-2026)

Licencia

Chroma:
Apache-2.0
Qdrant:
Apache-2.0

Mejor para

Chroma:
Prototipado rápido y pipelines RAG Python-first con una superficie de API mínima
Qdrant:
Cargas de trabajo que necesitan filtrado de metadatos rico y estructurado junto con la búsqueda vectorial, o una huella desplegable en el edge

Ambos proyectos publican actualizaciones con frecuencia y ambos ofrecen un nivel de nube gestionada aparte junto a su base de datos de código abierto — verifica la paridad de funciones y los precios actuales en el sitio de cada proyecto antes de elegir, en lugar de basarte en una comparación puntual.

¿Quién debería usar Chroma?

Que Chroma encaje o no depende de si necesitas una base de datos de vectores dedicada y autoalojable con una API mínima, en lugar de una capa más amplia de memoria/grafo de conocimiento o una base de datos centrada en el filtrado.

Competidores y alternativas

Chroma se sitúa en la capa de base de datos de vectores e infraestructura de recuperación, junto a almacenes de vectores embebidos y frameworks de RAG/datos más amplios que los desarrolladores suelen evaluar juntos. No son productos idénticos — algunos son bases de datos embebidas más estrechas, otros son frameworks de indexación u orquestación más amplios — pero compiten por la misma decisión: "¿dónde almaceno y consulto mis embeddings?"

txtai

Best known for:
Base de datos de vectores embebida y biblioteca de búsqueda semántica ligera
Artículos sobre txtai (1)

También mencionado en:

LlamaIndex

Best known for:
Framework de datos centrado específicamente en indexación y recuperación para aplicaciones LLM
Artículos sobre LlamaIndex (10)

+15 más no mostrados

LangChain

Best known for:
Framework de aplicación LLM de propósito general con un gran ecosistema de integraciones de recuperación y agentes
Artículos sobre LangChain (10)

+29 más no mostrados

Haystack (deepset)

Best known for:
Framework de código abierto de pipelines de RAG y búsqueda de deepset

Esta no es una lista exhaustiva de bases de datos de vectores y herramientas de recuperación — consulta el Directorio de Software LLM Local para el catálogo completo y actualizado con regularidad, incluida la propia entrada de directorio de Chroma.

Errores comunes al evaluar Chroma

La mayor parte de la confusión en torno a Chroma viene de confundirlo con la herramienta de diseño homónima y no relacionada, de asumir que las funciones de Chroma Cloud se aplican a la base de datos de código abierto, o de perder datos por usar el modo de cliente equivocado.

Preguntas frecuentes

¿Qué es Chroma?

Chroma (trychroma.com, código fuente en github.com/chroma-core/chroma) es una base de datos de embeddings gratuita y de código abierto (Apache-2.0) — una base de datos de vectores creada para aplicaciones de IA como la generación aumentada por recuperación y la búsqueda semántica. Este es el proyecto chroma-core/chroma, no la herramienta de diseño/color homónima y no relacionada.

¿Es gratis Chroma?

Sí, la base de datos de código abierto de Chroma es gratuita y tiene licencia Apache-2.0, sin ningún nivel de pago que limite ninguna función de la base de datos autoalojada. Chroma Cloud es una oferta gestionada aparte y opcional con su propio nivel de precios independiente — consulta trychroma.com para conocer los precios actuales.

¿Cómo instalo Chroma?

Ejecuta pip install chromadb para Python, o npm install chromadb para JavaScript/TypeScript. No se necesita clave de API ni cuenta para la base de datos autoalojada de código abierto.

¿Chroma funciona totalmente offline y autoalojado?

Sí. La base de datos de código abierto de Chroma se ejecuta por completo en tu propia infraestructura en todos los modos de despliegue — en memoria, almacenamiento local persistente o cliente-servidor. Chroma Cloud es una oferta gestionada aparte y opcional para equipos que prefieren no autoalojarla.

¿Cuáles son los modos de despliegue de Chroma?

Tres: un modo en memoria/efímero para prototipado rápido (los datos se pierden al salir), almacenamiento local persistente para que los datos sobrevivan a los reinicios, y una arquitectura cliente-servidor para acceso compartido multiproceso.

¿Cuál es la API principal de Chroma?

Cuatro funciones cubren el flujo de trabajo principal: create_collection para definir una colección, add para insertar documentos (con metadatos e IDs opcionales), query para buscar por similitud semántica, y delete para eliminar entradas.

¿Chroma gestiona los embeddings automáticamente?

Sí, por defecto. Si añades texto plano sin aportar tus propios embeddings, Chroma tokeniza, embebe e indexa los documentos por ti usando una función de embedding predeterminada; también puedes aportar tus propios embeddings y modelo de embedding si lo prefieres.

¿En qué se diferencia Chroma de Qdrant?

Chroma está escrito principalmente en Python, con una API principal deliberadamente pequeña, y suele elegirse para prototipado rápido. Qdrant está escrito en Rust y se construye en torno a un filtrado de metadatos más extenso (rangos numéricos, geolocalización, texto completo, condiciones lógicas). Ambos tienen licencia Apache-2.0, son autoalojables y también ofrecen un nivel de nube gestionada aparte — consulta la comparación completa más arriba.

¿Qué licencia usa Chroma?

Apache-2.0, confirmada a través del clasificador del paquete en PyPI y el repositorio de GitHub.

¿Con qué frameworks se integra Chroma?

Chroma se usa habitualmente como backend de almacén de vectores dentro de pipelines RAG de LangChain y LlamaIndex, combinado con un modelo de embedding local (por ejemplo vía Ollama) o una API de embedding en la nube.

¿Es Chroma lo mismo que la herramienta de diseño/color llamada Chroma?

No. Esta review cubre chroma-core/chroma, la base de datos de vectores de IA de código abierto en trychroma.com y github.com/chroma-core/chroma. Existe un producto separado y no relacionado que también usa el nombre "Chroma" en el ámbito de las herramientas de diseño/color — verifica que tienes el proyecto correcto antes de instalar nada.

¿Qué es Chroma Cloud?

Chroma Cloud es una oferta gestionada/serverless aparte y opcional, construida sobre la misma base de datos, para equipos que no quieren autoalojarla. El propio sitio de Chroma menciona funciones como el cumplimiento SOC 2 Tipo II y Bring Your Own Cloud (BYOC) en ese nivel — verifica las funciones y los precios actuales directamente en trychroma.com.

Fuentes

← Volver a LLM locales avanzados