Conclusiones clave
- Chroma (trychroma.com) es una base de datos de embeddings gratuita y de código abierto creada específicamente para aplicaciones de IA, no una base de datos de propósito general readaptada para vectores
- Con licencia Apache-2.0, confirmado a través del repositorio de GitHub
- Más de 29.300 estrellas en GitHub en el momento de esta review (verificado el 18-09-2026)
- Localidad: totalmente autoalojable — la base de datos de código abierto se ejecuta por completo en tu propia infraestructura; Chroma Cloud es una oferta gestionada aparte y opcional
- La API principal consta de cuatro funciones:
create_collection,add,queryydelete - Tres modos de despliegue: en memoria/efímero (prototipado), almacenamiento local persistente y arquitectura cliente-servidor
- Se usa habitualmente como backend de almacén de vectores dentro de pipelines RAG de LangChain y LlamaIndex, combinado con modelos de embedding locales vía Ollama o APIs de embedding en la nube
📍 En una frase
Chroma es una base de datos de vectores/embeddings gratuita y de código abierto (Apache-2.0), el proyecto chroma-core/chroma (no la herramienta de diseño homónima y no relacionada), creada específicamente para aplicaciones de IA como RAG y búsqueda semántica, y se puede autoalojar en memoria, en disco local o como despliegue cliente-servidor.
💬 En términos simples
En lugar de construir tu propia capa de almacenamiento para los "embeddings" numéricos que representan tus documentos, Chroma los guarda por ti y te permite buscar por significado en lugar de por palabras clave exactas. Gestiona la tokenización y el embedding automáticamente si le das texto plano, se ejecuta en tu propia máquina o servidor con pip install chromadb, y es gratis.
📌Nota: Esta review es el complemento en profundidad de la entrada de Chroma en el Directorio de Software LLM Local — consulta esa página para ver de un vistazo cómo se compara Chroma con decenas de otras herramientas de IA locales y autoalojadas.
¿Qué es Chroma?
Chroma es una base de datos de embeddings de código abierto que almacena, indexa y busca las representaciones vectoriales de tu texto, imágenes u otros datos, de modo que las aplicaciones de IA puedan recuperar información por similitud semántica en lugar de por coincidencia exacta de palabras clave. Su propia descripción en GitHub y el eslogan de su sitio la posicionan como "infraestructura de búsqueda de código abierto para IA" y "la infraestructura de datos de código abierto para IA", construida en torno a una API principal deliberadamente sencilla.
- Tipo de producto: una base de datos de vectores/embeddings autoalojada, distribuida como biblioteca de Python y JavaScript más un binario de servidor opcional — no una aplicación de escritorio con GUI independiente
- Repositorio: github.com/chroma-core/chroma
- Licencia: Apache-2.0, confirmada a través del clasificador de licencia del repositorio en PyPI
- Localidad: totalmente autoalojable — la base de datos de código abierto de Chroma se ejecuta por completo en tu propia infraestructura en todos los modos de despliegue; Chroma Cloud es una oferta gestionada/serverless aparte y opcional para equipos que no quieren operarla ellos mismos
- Escala: más de 29.300 estrellas en GitHub, y el propio sitio de Chroma cita más de 15 millones de descargas mensuales del paquete
chromadby uso en más de 90.000 bases de código de código abierto — cifras que reflejan la huella de descargas del paquete más que necesariamente un recuento de despliegues de producción únicos - Entre los clientes nombrados en el propio sitio de Chroma están Capital One, Mintlify, UnitedHealthcare, Conduit, Propel, Cofounder, Weights & Biases y Medwise
Historia del proyecto Chroma
Chroma se desarrolla como proyecto de código abierto bajo la organización chroma-core en GitHub, y Chroma Cloud se introdujo más tarde como oferta gestionada aparte, construida sobre la misma base de datos. Esta review verificó el número actual de estrellas en GitHub, la licencia y los detalles del paquete directamente en el repositorio y los registros de paquetes de Chroma, pero no pudo verificar un nombre concreto de fundador o empresa a partir de una fuente primaria y fechada durante la investigación — por eso esta review no indica ninguno. Si necesitas ese detalle, consulta directamente el propio sitio de Chroma y la cobertura de prensa en lugar de basarte en una fuente secundaria.
- La API principal de Chroma se construyó en torno a una superficie deliberadamente pequeña:
create_collection,add,queryydelete, con el objetivo de poner en marcha rápidamente un pipeline de recuperación funcional - El proyecto ha crecido hasta superar las 29.300 estrellas en GitHub y, según el propio sitio de Chroma, más de 15 millones de descargas mensuales del paquete
chromadben el momento de esta review - Chroma Cloud, una oferta gestionada/serverless aparte, se introdujo como vía opcional para equipos que quieren la misma base de datos sin autoalojarla — el sitio de Chroma menciona funciones como el cumplimiento SOC 2 Tipo II, el escalonamiento automático de datos (data tiering) y Bring Your Own Cloud (BYOC) para empresas en ese nivel gestionado
- La última versión de
chromadben PyPI en el momento de esta review es la 1.5.9, publicada el 05-05-2026
¿Qué puedes hacer con Chroma?
El conjunto de funciones de Chroma se centra en almacenar y consultar embeddings para aplicaciones de IA, según el propio README de GitHub y la documentación de Chroma.
- API principal sencilla — cuatro funciones cubren el flujo de trabajo principal:
create_collectionpara definir una colección,addpara insertar documentos,querypara buscar por similitud ydeletepara eliminar entradas - Gestión automática de embeddings — si le das a Chroma texto plano sin aportar tus propios embeddings, tokeniza, embebe e indexa los documentos por ti usando una función de embedding predeterminada
- Filtrado por metadatos — puedes asociar metadatos a los documentos al añadirlos y filtrar los resultados de las consultas por esos metadatos junto con la similitud semántica
- Tres modos de despliegue — en memoria/efímero para prototipado rápido, almacenamiento local persistente para que los datos sobrevivan a los reinicios del proceso, y una arquitectura cliente-servidor para acceso compartido multiproceso
- SDKs de lenguaje — clientes oficiales de Python (
chromadben PyPI) y JavaScript/TypeScript (chromadben npm) - Integraciones con frameworks — Chroma se usa habitualmente como backend de almacén de vectores dentro de pipelines RAG de LangChain y LlamaIndex, combinado con modelos de embedding locales (por ejemplo vía Ollama) o una API de embedding en la nube
- Chroma Cloud (oferta aparte) — un nivel gestionado y serverless que el propio sitio de Chroma describe como compatible con búsqueda vectorial, de texto completo, por expresiones regulares y por metadatos, además de búsqueda vectorial dispersa (BM25, SPLADE), escalonamiento automático de datos, cumplimiento SOC 2 Tipo II y Bring Your Own Cloud (BYOC) para empresas; verifica la disponibilidad actual de funciones directamente en trychroma.com, ya que son funciones del nivel gestionado y no todas están necesariamente presentes en la base de datos de código abierto autoalojada
Ejemplos de uso: tres formas de usar Chroma
Estos son flujos de trabajo concretos basados en la API documentada de Chroma, ejecutados tras pip install chromadb.
- Crear un cliente en memoria y añadir y consultar documentos:
chromadb.Client()crea un cliente efímero,create_collection()define una colección con nombre,add()inserta documentos con metadatos e IDs opcionales, yquery()busca por similitud semántica — Chroma tokeniza y embebe el texto automáticamente si no le pasas tus propios embeddings - Usar un cliente local persistente para que los datos sobrevivan a los reinicios: la API documentada de Chroma incluye un modo de cliente persistente (habitualmente
chromadb.PersistentClient(path=...)en las versiones actuales) que escribe los datos en disco local en lugar de mantenerlos solo en memoria — verifica el constructor y los argumentos exactos actuales en docs.trychroma.com antes de publicar código que dependa de ello, ya que las APIs del cliente pueden cambiar entre versiones - Combinar Chroma con LangChain como almacén de vectores en un pipeline RAG: el flujo de trabajo típico es cargar y dividir tus documentos, embeberlos con un modelo de embedding compatible con LangChain (local vía Ollama o un proveedor en la nube), almacenar los vectores en una colección de Chroma a través de la integración de almacén de vectores Chroma de LangChain, y luego consultar ese almacén como paso de recuperación en una cadena de recuperación — consulta la documentación actual de LangChain para conocer el paquete de integración y la ruta de importación exactos, ya que la integración de Chroma en LangChain se ha movido entre paquetes con el tiempo
import chromadb
client = chromadb.Client()
collection = client.create_collection(name="my_collection")
collection.add(
documents=["This is document1"],
metadatas=[{"source": "notion"}],
ids=["doc1"],
)
results = collection.query(
query_texts=["This is a query document"],
n_results=2,
)Instalar Chroma
Chroma se instala gratis vía pip o npm, y su código fuente está en GitHub. No hay un instalador de GUI independiente, ya que Chroma es una base de datos que añades a un proyecto de Python o JavaScript (con un componente de servidor opcional para despliegues cliente-servidor).
Source | Link |
|---|---|
| Sitio oficial (documentación, casos de uso, Chroma Cloud) | trychroma.com |
| Documentación | docs.trychroma.com |
| Repositorio de GitHub (código fuente, Apache-2.0) | github.com/chroma-core/chroma |
| Paquete de PyPI (Python) | pypi.org/project/chromadb |
| Paquete de npm (JavaScript/TypeScript) | npmjs.com/package/chromadb |
Instala con pip install chromadb (Python) o npm install chromadb (JavaScript). No se necesita clave de API ni cuenta para la base de datos de código abierto autoalojada — solo hace falta una cuenta si eliges usar la oferta aparte de Chroma Cloud.
Precios de Chroma: ¿es realmente gratis?
La base de datos de código abierto de Chroma es gratuita y tiene licencia Apache-2.0 — no hay ningún nivel de pago que limite ninguna función de la base de datos autoalojada en sí. Chroma Cloud es una oferta gestionada aparte y opcional para equipos que quieren una versión serverless y alojada sin operar ellos mismos la base de datos; en el momento de esta review, trychroma.com menciona un inicio gratuito en Chroma Cloud con una asignación inicial de crédito gratuito — consulta trychroma.com directamente para conocer las condiciones actuales en lugar de asumir una cifra concreta, ya que las ofertas del nivel gestionado cambian con más frecuencia que las condiciones de la licencia de código abierto.
- Base de datos de código abierto: gratuita, Apache-2.0, sin límites de uso impuestos por Chroma
- Tus propios costes se limitan a tu propia infraestructura (cómputo y almacenamiento) más el proveedor de embeddings que uses, si eliges una API de embedding en la nube de pago en lugar de un modelo local
- Chroma Cloud: una oferta gestionada/serverless aparte y opcional; en el momento de esta review el sitio menciona una asignación inicial de crédito gratuito para cuentas nuevas, pero verifica los precios y las condiciones del crédito actuales directamente en trychroma.com antes de presupuestar en torno a una cifra concreta
- No se requiere cuenta ni registro para instalar y usar la base de datos de código abierto
Chroma vs. Qdrant
Chroma y Qdrant son bases de datos de vectores de código abierto y autoalojables que los desarrolladores suelen comparar entre sí para backends de RAG y búsqueda semántica, pero difieren en el lenguaje de implementación, las opciones de despliegue y hasta dónde llegan sus capacidades de filtrado. Chroma está escrito principalmente en Python, con una API principal deliberadamente pequeña, y suele elegirse por lo rápido que permite poner en marcha un prototipo. Qdrant está escrito en Rust, se construye en torno a capacidades de filtrado más extensas (coincidencia de palabras clave, búsqueda de texto completo, rangos numéricos y condiciones de geolocalización combinadas con operadores lógicos sobre payloads JSON), y añade un modo ligero "Qdrant Edge" para ejecutarse dentro de aplicaciones en dispositivos edge, además de su propia oferta gestionada Qdrant Cloud.
Escrito en
- Chroma:
- Python (con un núcleo respaldado por Rust en versiones recientes)
- Qdrant:
- Rust
Filosofía de la API principal
- Chroma:
- Deliberadamente pequeña: create_collection, add, query, delete
- Qdrant:
- API más amplia con filtrado extenso de payload (texto completo, rango numérico, geo)
Modos de despliegue
- Chroma:
- En memoria/efímero, almacenamiento local persistente, cliente-servidor
- Qdrant:
- Cliente-servidor con Docker, modo integrado ligero "Edge", Qdrant Cloud gestionado
Estrellas en GitHub (verificadas para esta review)
- Chroma:
- Más de 29.300 (verificado 18-09-2026)
- Qdrant:
- Más de 34.700 (verificado 18-09-2026)
Licencia
- Chroma:
- Apache-2.0
- Qdrant:
- Apache-2.0
Mejor para
- Chroma:
- Prototipado rápido y pipelines RAG Python-first con una superficie de API mínima
- Qdrant:
- Cargas de trabajo que necesitan filtrado de metadatos rico y estructurado junto con la búsqueda vectorial, o una huella desplegable en el edge
Ambos proyectos publican actualizaciones con frecuencia y ambos ofrecen un nivel de nube gestionada aparte junto a su base de datos de código abierto — verifica la paridad de funciones y los precios actuales en el sitio de cada proyecto antes de elegir, en lugar de basarte en una comparación puntual.
¿Quién debería usar Chroma?
Que Chroma encaje o no depende de si necesitas una base de datos de vectores dedicada y autoalojable con una API mínima, en lugar de una capa más amplia de memoria/grafo de conocimiento o una base de datos centrada en el filtrado.
Competidores y alternativas
Chroma se sitúa en la capa de base de datos de vectores e infraestructura de recuperación, junto a almacenes de vectores embebidos y frameworks de RAG/datos más amplios que los desarrolladores suelen evaluar juntos. No son productos idénticos — algunos son bases de datos embebidas más estrechas, otros son frameworks de indexación u orquestación más amplios — pero compiten por la misma decisión: "¿dónde almaceno y consulto mis embeddings?"
txtai
- Best known for:
- Base de datos de vectores embebida y biblioteca de búsqueda semántica ligera
- Link:
- review de txtai
Artículos sobre txtai (1)
- txtai Review 2026: The Embedded Vector Database That Skips the ServerActualizado 2 de septiembre de 2026
También mencionado en:
- Weaviate Review 2026: The Self-Hostable Vector Database for RAGActualizado 19 de septiembre de 2026
- Milvus Review 2026: The Open-Source Vector Database for Local RAGActualizado 18 de septiembre de 2026
- Qdrant Review 2026: The Self-Hosted Vector Database for RAGActualizado 18 de septiembre de 2026
LlamaIndex
- Best known for:
- Framework de datos centrado específicamente en indexación y recuperación para aplicaciones LLM
- Link:
- review de LlamaIndex
Artículos sobre LlamaIndex (10)
- LlamaIndex Review 2026: Code-First RAG Framework, Not a No-Code BuilderActualizado 2 de septiembre de 2026
- Chroma Review: Open-Source Vector Database for AI and RAGActualizado 18 de septiembre de 2026
- Milvus Review 2026: The Open-Source Vector Database for Local RAGActualizado 18 de septiembre de 2026
- Qdrant Review 2026: The Self-Hosted Vector Database for RAGActualizado 18 de septiembre de 2026
- Dify Review 2026: Open-Source LLMOps Platform vs. LangChain, FlowiseActualizado 2 de septiembre de 2026
- Flowise Review 2026: Visual LangChain Workflow Builder Is Shutting DownActualizado 2 de septiembre de 2026
- Haystack Review 2026: deepset's RAG Framework vs. LangChain and LlamaIndexActualizado 2 de septiembre de 2026
- RAGFlow Review 2026: Citation-Grade RAG for Complex DocumentsActualizado 2 de septiembre de 2026
- txtai Review 2026: The Embedded Vector Database That Skips the ServerActualizado 2 de septiembre de 2026
- Best Local RAG Tools in 2026: Open WebUI, LlamaIndex, and LangChainActualizado 28 de agosto de 2026
+15 más no mostrados
LangChain
- Best known for:
- Framework de aplicación LLM de propósito general con un gran ecosistema de integraciones de recuperación y agentes
- Link:
- review de LangChain
Artículos sobre LangChain (10)
- LangChain Review 2026: Features, Pricing, AlternativesActualizado 5 de septiembre de 2026
- Self-Hosted AI Starter Kit Review 2026: n8n + Ollama + Qdrant in One Compose FileActualizado 19 de septiembre de 2026
- Chroma Review: Open-Source Vector Database for AI and RAGActualizado 18 de septiembre de 2026
- cognee Review: Open-Source Knowledge-Graph Memory for AI AgentsActualizado 18 de septiembre de 2026
- Langchain-Chatchat Review 2026: Self-Hosted RAG and Agent FrameworkActualizado 18 de septiembre de 2026
- Milvus Review 2026: The Open-Source Vector Database for Local RAGActualizado 18 de septiembre de 2026
- Qdrant Review 2026: The Self-Hosted Vector Database for RAGActualizado 18 de septiembre de 2026
- Docker Model Runner Review 2026: Local LLMs via the Docker CLIActualizado 12 de septiembre de 2026
- n8n Review 2026: AI Workflow Automation With Local Ollama SupportActualizado 12 de septiembre de 2026
- Agent Zero Review 2026: Features, Install, AlternativesActualizado 11 de septiembre de 2026
+29 más no mostrados
Haystack (deepset)
- Best known for:
- Framework de código abierto de pipelines de RAG y búsqueda de deepset
- Link:
- review de Haystack
Esta no es una lista exhaustiva de bases de datos de vectores y herramientas de recuperación — consulta el Directorio de Software LLM Local para el catálogo completo y actualizado con regularidad, incluida la propia entrada de directorio de Chroma.
Errores comunes al evaluar Chroma
La mayor parte de la confusión en torno a Chroma viene de confundirlo con la herramienta de diseño homónima y no relacionada, de asumir que las funciones de Chroma Cloud se aplican a la base de datos de código abierto, o de perder datos por usar el modo de cliente equivocado.
Preguntas frecuentes
¿Qué es Chroma?
Chroma (trychroma.com, código fuente en github.com/chroma-core/chroma) es una base de datos de embeddings gratuita y de código abierto (Apache-2.0) — una base de datos de vectores creada para aplicaciones de IA como la generación aumentada por recuperación y la búsqueda semántica. Este es el proyecto chroma-core/chroma, no la herramienta de diseño/color homónima y no relacionada.
¿Es gratis Chroma?
Sí, la base de datos de código abierto de Chroma es gratuita y tiene licencia Apache-2.0, sin ningún nivel de pago que limite ninguna función de la base de datos autoalojada. Chroma Cloud es una oferta gestionada aparte y opcional con su propio nivel de precios independiente — consulta trychroma.com para conocer los precios actuales.
¿Cómo instalo Chroma?
Ejecuta pip install chromadb para Python, o npm install chromadb para JavaScript/TypeScript. No se necesita clave de API ni cuenta para la base de datos autoalojada de código abierto.
¿Chroma funciona totalmente offline y autoalojado?
Sí. La base de datos de código abierto de Chroma se ejecuta por completo en tu propia infraestructura en todos los modos de despliegue — en memoria, almacenamiento local persistente o cliente-servidor. Chroma Cloud es una oferta gestionada aparte y opcional para equipos que prefieren no autoalojarla.
¿Cuáles son los modos de despliegue de Chroma?
Tres: un modo en memoria/efímero para prototipado rápido (los datos se pierden al salir), almacenamiento local persistente para que los datos sobrevivan a los reinicios, y una arquitectura cliente-servidor para acceso compartido multiproceso.
¿Cuál es la API principal de Chroma?
Cuatro funciones cubren el flujo de trabajo principal: create_collection para definir una colección, add para insertar documentos (con metadatos e IDs opcionales), query para buscar por similitud semántica, y delete para eliminar entradas.
¿Chroma gestiona los embeddings automáticamente?
Sí, por defecto. Si añades texto plano sin aportar tus propios embeddings, Chroma tokeniza, embebe e indexa los documentos por ti usando una función de embedding predeterminada; también puedes aportar tus propios embeddings y modelo de embedding si lo prefieres.
¿En qué se diferencia Chroma de Qdrant?
Chroma está escrito principalmente en Python, con una API principal deliberadamente pequeña, y suele elegirse para prototipado rápido. Qdrant está escrito en Rust y se construye en torno a un filtrado de metadatos más extenso (rangos numéricos, geolocalización, texto completo, condiciones lógicas). Ambos tienen licencia Apache-2.0, son autoalojables y también ofrecen un nivel de nube gestionada aparte — consulta la comparación completa más arriba.
¿Qué licencia usa Chroma?
Apache-2.0, confirmada a través del clasificador del paquete en PyPI y el repositorio de GitHub.
¿Con qué frameworks se integra Chroma?
Chroma se usa habitualmente como backend de almacén de vectores dentro de pipelines RAG de LangChain y LlamaIndex, combinado con un modelo de embedding local (por ejemplo vía Ollama) o una API de embedding en la nube.
¿Es Chroma lo mismo que la herramienta de diseño/color llamada Chroma?
No. Esta review cubre chroma-core/chroma, la base de datos de vectores de IA de código abierto en trychroma.com y github.com/chroma-core/chroma. Existe un producto separado y no relacionado que también usa el nombre "Chroma" en el ámbito de las herramientas de diseño/color — verifica que tienes el proyecto correcto antes de instalar nada.
¿Qué es Chroma Cloud?
Chroma Cloud es una oferta gestionada/serverless aparte y opcional, construida sobre la misma base de datos, para equipos que no quieren autoalojarla. El propio sitio de Chroma menciona funciones como el cumplimiento SOC 2 Tipo II y Bring Your Own Cloud (BYOC) en ese nivel — verifica las funciones y los precios actuales directamente en trychroma.com.