Conclusiones clave
- Licencia Apache 2.0 — gratis para autoalojar, modificar y redistribuir
- Desarrollado por InfiniFlow, un motor RAG de código abierto que fusiona recuperación con capacidades de agente
- Comprensión profunda de documentos: el análisis sensible al diseño extrae tablas, figuras y estructura en lugar de aplanar un archivo a texto plano
- Citas verificables: cada respuesta enlaza al fragmento específico del que fue generada, con vista previa
- Se autoaloja vía Docker; hardware mínimo: 4 núcleos de CPU, 16 GB de RAM, 50 GB de disco
- Ideal para flujos de trabajo con documentos complejos (contratos, estados financieros, informes escaneados); una herramienta más ligera basta para Q&A de texto plano
- También existe una nube gestionada de pago (cloud.ragflow.io) para equipos que prefieren no autoalojar — esta reseña cubre el despliegue autoalojado y de código abierto
📍 En una frase
RAGFlow es un motor RAG de código abierto (Apache 2.0) y autoalojado, especializado en comprensión profunda de documentos — análisis sensible al diseño de PDFs complejos, tablas y archivos escaneados — cuyas respuestas remiten a su fragmento fuente exacto.
💬 En términos simples
En lugar de tratar un PDF como una larga cadena de texto, RAGFlow lee su diseño — las tablas siguen siendo tablas, las notas al pie permanecen ligadas a su página — y muestra exactamente qué fragmento del documento usó para responder tu pregunta.
¿Qué es RAGFlow?
RAGFlow (github.com/infiniflow/ragflow) es un motor RAG de código abierto desarrollado por InfiniFlow, publicado bajo licencia Apache 2.0. Su propia documentación lo describe como una fusión de generación aumentada por recuperación con capacidades de agente para crear una capa de contexto para LLMs — en la práctica, una aplicación autoalojada con interfaz web para construir sistemas de preguntas y respuestas documentales y flujos de trabajo agénticos.
- Comprensión profunda de documentos: un pipeline de análisis sensible al diseño (DeepDoc) extrae texto, tablas y figuras de formatos de archivo complejos en lugar de tratar cada archivo como texto plano
- Fragmentación (chunking) inteligente basada en plantillas, que RAGFlow describe como "explicable" — puedes ver y ajustar cómo se dividió un documento antes de indexarlo
- Citas verificables con vista previa del fragmento fuente, para comprobar una respuesta contra el pasaje exacto del que proviene
- Capacidades agénticas: un constructor de flujos de trabajo visual para encadenar recuperación, herramientas y razonamiento multi-paso, además de soporte para Model Context Protocol (MCP)
- Admite Word, Slides, Excel, TXT, imágenes, copias escaneadas, datos estructurados, páginas web y más como documentos fuente
- Se puede desplegar vía Docker para autoalojamiento, o mediante la nube gestionada de pago de InfiniFlow (cloud.ragflow.io) si prefieres no operar tu propia infraestructura
Comprensión profunda de documentos y citas — el diferenciador central de RAGFlow
El RAG simple es fácil cuando un documento es un archivo de texto limpio. Los documentos empresariales rara vez lo son — un contrato puede contener tablas anidadas, notas al pie, encabezados, páginas escaneadas y referencias cruzadas, y una conversión ingenua de PDF a texto colapsa todo eso en un bloque no estructurado. RAGFlow está construido específicamente para analizar esa estructura en lugar de descartarla.
📌Nota: RAGFlow también admite construcción de grafos de conocimiento al estilo GraphRAG y una profundidad de razonamiento agéntico configurable, además del pipeline documental principal — evalúa esto según tu propio caso de uso en lugar de asumir que lo necesitas para un Q&A documental básico.
¿En qué se diferencia RAGFlow de Quivr, Dify y LlamaIndex?
Las cuatro herramientas tocan la generación aumentada por recuperación, pero resuelven problemas distintos. RAGFlow debe evaluarse frente a aplicaciones de Q&A documental listas para usar como Quivr, no frente a una base de datos vectorial o un framework de código — compiten por la misma decisión de compra: "apúntalo a mis documentos y haz preguntas".
¿Cómo autoalojar RAGFlow?
RAGFlow se despliega vía Docker. Estos son los pasos documentados en la guía de inicio rápido oficial del proyecto, vigentes al momento de esta reseña — revisa siempre la documentación del repositorio para conocer la última versión etiquetada antes de desplegar.
- 1Confirma que tu máquina cumple los mínimos: CPU con 4 o más núcleos (x86), 16 GB o más de RAM, 50 GB o más de disco libre, Docker 24.0.0+ y Docker Compose v2.26.1+.
- 2En Linux, aumenta el límite de memory map del kernel para el componente de búsqueda incluido: sudo sysctl -w vm.max_map_count=262144, y luego añade vm.max_map_count=262144 a /etc/sysctl.conf para que sobreviva a un reinicio.
- 3Clona el repositorio y cambia a una versión estable etiquetada: git clone https://github.com/infiniflow/ragflow.git, luego cd ragflow/docker && git checkout -f v0.27.1 (usa la etiqueta vigente al momento de tu despliegue).
- 4Inicia el stack: docker compose -f docker-compose.yml up -d. Sigue los logs con docker logs -f docker-ragflow-cpu-1 y espera la confirmación de un inicio exitoso antes de continuar.
- 5Abre http://<IP-de-tu-servidor> en un navegador (RAGFlow escucha en el puerto 80 por defecto), ve a Model providers y añade la clave API o el endpoint del LLM y del modelo de embeddings que planeas usar.
- 6Crea un dataset, elige un modelo de embeddings y un método de fragmentación, sube tus archivos y pulsa el botón de reproducir para analizarlos — luego revisa los fragmentos resultantes y crea un chat vinculado a ese dataset para empezar a hacer preguntas.
¿RAGFlow puede funcionar sin conexión a internet?
RAGFlow en sí funciona completamente sin conexión una vez desplegado, pero necesita un LLM para generar respuestas. Apúntalo a un servidor de modelos local (por ejemplo, un endpoint compatible con Ollama) en lugar de una API en la nube para mantener todo el pipeline sin conexión — revisa la configuración de proveedores de modelo de RAGFlow para saber qué endpoints locales admite.
¿Cuánto espacio en disco necesita realmente RAGFlow?
El mínimo documentado es de 50 GB libres, además del espacio que ocuparán tus documentos indexados y los fragmentos/embeddings generados. Presupuesta más para colecciones de documentos grandes, ya que RAGFlow almacena fragmentos analizados y embeddings además de los archivos fuente.
¿Quién debería usar RAGFlow?
La profundidad de análisis documental de RAGFlow es una ventaja real para archivos complejos y un costo real —en complejidad de instalación y hardware— para equipos que no la necesitan.
RAGFlow vs. Alternativas
Una comparación directa según los criterios que realmente importan a los compradores: interfaz, manejo de documentos y licencia.
Herramienta | Interfaz | Análisis documental | Citas | Licencia |
|---|---|---|---|---|
| RAGFlow | App web + constructor de agentes | Sensible al diseño / tablas y escaneos | Trazables al fragmento fuente | Apache 2.0 |
| Quivr | App web | Extracción de texto genérica | Referencias fuente | Código abierto |
| Dify | App web + constructor de flujos | Genérico (RAG es un módulo) | Referencias fuente | Código abierto |
| LlamaIndex | Framework de código, sin UI | Configurable con tus propios loaders | Las implementas tú | MIT |
Errores comunes al evaluar RAGFlow
Estos errores vienen de tratar RAGFlow como un reemplazo directo de una herramienta más simple, o al revés —subaprovisionarlo y culpar al software.
Preguntas frecuentes
¿Qué es RAGFlow?
RAGFlow es un motor RAG de código abierto (Apache 2.0) desarrollado por InfiniFlow, especializado en comprensión profunda de documentos. Un analizador sensible al diseño extrae tablas, figuras y estructura de documentos complejos, y cada respuesta generada enlaza al fragmento fuente exacto del que proviene.
¿RAGFlow es gratuito?
El despliegue autoalojado y de código abierto es gratuito bajo licencia Apache 2.0. InfiniFlow también ofrece una nube gestionada de pago independiente (cloud.ragflow.io) para equipos que prefieren no operar su propia infraestructura — es un producto distinto del software gratuito autoalojado que cubre esta reseña.
¿Bajo qué licencia se publica RAGFlow?
Apache License 2.0, que permite uso, modificación y redistribución libres, incluso en productos comerciales.
¿Cómo funciona la función de citas de RAGFlow?
Cada respuesta generada por RAGFlow incluye referencias a los fragmentos específicos de los que fue construida. La interfaz permite previsualizar el pasaje citado dentro del documento original, para verificar la respuesta contra su fuente real en lugar de confiar solo en el resumen.
¿Qué diferencia a RAGFlow de una herramienta RAG típica?
La mayoría de las herramientas RAG convierten un documento a texto plano antes de fragmentarlo, lo que pierde la estructura de las tablas, las notas al pie y el diseño. RAGFlow analiza primero el diseño —las tablas siguen siendo tablas— lo cual importa específicamente para documentos empresariales complejos como contratos escaneados y estados financieros.
¿Qué formatos de documento admite RAGFlow?
Word, Slides, Excel, TXT, imágenes, copias escaneadas, datos estructurados y páginas web, según la documentación del proyecto. Revisa el repositorio de GitHub actual para la lista completa y actualizada de formatos antes de desplegar, ya que RAGFlow añade soporte para nuevos formatos con frecuencia.
¿Puedo autoalojar RAGFlow?
Sí. RAGFlow se despliega vía Docker y Docker Compose en tu propia infraestructura. El hardware mínimo documentado es 4 núcleos de CPU, 16 GB de RAM y 50 GB de disco libre.
¿Cuáles son los requisitos de hardware para autoalojar RAGFlow?
CPU con 4 o más núcleos (x86), 16 GB o más de RAM, 50 GB o más de espacio en disco libre, Docker 24.0.0 o superior, y Docker Compose v2.26.1 o superior, según la documentación de inicio rápido de RAGFlow.
RAGFlow vs. LlamaIndex — ¿cuál debería usar?
Elige LlamaIndex si necesitas un pipeline de recuperación totalmente personalizado construido en código, con tu propia elección de base de datos vectorial y sin UI empaquetada. Elige RAGFlow si una aplicación web lista para usar con un análisis de documentos sólido ya cubre tus necesidades, sin tener que escribir tu propio pipeline de recuperación.
¿RAGFlow admite agentes de IA, no solo RAG?
Sí. Más allá de la recuperación documental, RAGFlow incluye un constructor de flujos de trabajo visual para encadenar pasos de recuperación, herramientas y razonamiento multi-paso, junto con soporte para Model Context Protocol (MCP) para conectar herramientas externas a un agente.
