Points clés
- Licence Apache 2.0 — auto-hébergement, modification et redistribution gratuits
- Développé par InfiniFlow, un moteur RAG open source qui fusionne récupération et capacités agentiques
- Compréhension approfondie des documents : l'analyse sensible à la mise en page extrait tableaux, figures et structure au lieu d'aplatir un fichier en texte brut
- Citations vérifiables : chaque réponse renvoie au chunk exact dont elle est issue, avec un aperçu visuel
- Auto-hébergement via Docker ; matériel minimum : 4 cœurs CPU, 16 Go de RAM, 50 Go de disque
- Idéal pour les workflows documentaires complexes (contrats, états financiers, rapports scannés) ; un outil plus léger suffit pour du texte brut
- Un cloud managé payant (cloud.ragflow.io) existe aussi pour les équipes préférant ne pas auto-héberger — ce guide couvre le déploiement auto-hébergé et open source
📍 En une phrase
RAGFlow est un moteur RAG open source (Apache 2.0) et auto-hébergé, spécialisé dans la compréhension approfondie des documents — analyse sensible à la mise en page de PDF complexes, tableaux et fichiers scannés — dont les réponses remontent jusqu'à leur chunk source exact.
💬 En termes simples
Au lieu de traiter un PDF comme une longue chaîne de texte, RAGFlow lit sa mise en page — les tableaux restent des tableaux, les notes de bas de page restent liées à leur page — et montre exactement quel extrait du document a servi à répondre à votre question.
Qu'est-ce que RAGFlow ?
RAGFlow (github.com/infiniflow/ragflow) est un moteur RAG open source développé par InfiniFlow, publié sous licence Apache 2.0. Sa propre documentation le décrit comme une fusion de la génération augmentée par récupération avec des capacités agentiques pour créer une couche de contexte pour les LLM — concrètement, une application auto-hébergée avec interface web pour construire des systèmes de questions-réponses documentaires et des workflows agentiques.
- Compréhension approfondie des documents : un pipeline d'analyse sensible à la mise en page (DeepDoc) extrait texte, tableaux et figures de formats de fichiers complexes, plutôt que de traiter chaque fichier comme du texte brut
- Découpage (chunking) intelligent basé sur des modèles, que RAGFlow qualifie lui-même d'"explicable" — vous pouvez voir et ajuster comment un document a été découpé avant son indexation
- Citations vérifiables avec aperçu du chunk source, permettant de vérifier une réponse par rapport au passage exact dont elle provient
- Capacités agentiques : un constructeur de workflow visuel pour enchaîner récupération, outils et raisonnement multi-étapes, avec prise en charge du Model Context Protocol (MCP)
- Prend en charge Word, Slides, Excel, TXT, images, copies scannées, données structurées, pages web et plus comme documents source
- Déployable via Docker pour un auto-hébergement, ou via le cloud managé payant d'InfiniFlow (cloud.ragflow.io) si vous préférez ne pas gérer votre propre infrastructure
Compréhension approfondie des documents & citations — le cœur de RAGFlow
Le RAG simple est facile lorsqu'un document est un fichier texte propre. Les documents professionnels le sont rarement — un contrat peut contenir des tableaux imbriqués, des notes de bas de page, des en-têtes, des pages scannées et des renvois, et une conversion PDF-vers-texte naïve réduit tout cela à un bloc non structuré. RAGFlow est spécifiquement conçu pour analyser cette structure plutôt que de la perdre.
📌Remarque: RAGFlow prend aussi en charge la construction de graphes de connaissances façon GraphRAG et une profondeur de raisonnement agentique configurable, en plus du pipeline documentaire principal — évaluez ces fonctions selon votre propre usage plutôt que de supposer en avoir besoin pour un simple Q&A documentaire.
En quoi RAGFlow diffère-t-il de Quivr, Dify et LlamaIndex ?
Les quatre outils touchent à la génération augmentée par récupération, mais résolvent des problèmes différents. RAGFlow doit être comparé à des applications de questions-réponses documentaires prêtes à l'emploi comme Quivr, pas à une base de données vectorielle ou à un framework de code — ils se disputent la même décision d'achat : "pointer sur mes documents et poser des questions".
Comment auto-héberger RAGFlow ?
RAGFlow se déploie via Docker. Voici les étapes documentées dans le guide de démarrage officiel du projet, à jour au moment de ce test — vérifiez toujours la documentation du dépôt pour connaître la dernière version taguée avant tout déploiement.
- 1Vérifiez que votre machine respecte les minimums : CPU avec 4 cœurs ou plus (x86), 16 Go de RAM ou plus, 50 Go d'espace disque libre ou plus, Docker 24.0.0+ et Docker Compose v2.26.1+.
- 2Sous Linux, augmentez la limite de memory map du noyau pour le composant de recherche intégré : sudo sysctl -w vm.max_map_count=262144, puis ajoutez vm.max_map_count=262144 dans /etc/sysctl.conf pour que le réglage survive à un redémarrage.
- 3Clonez le dépôt et récupérez une version stable taguée : git clone https://github.com/infiniflow/ragflow.git, puis cd ragflow/docker && git checkout -f v0.27.1 (utilisez le tag en vigueur au moment de votre déploiement).
- 4Démarrez la pile : docker compose -f docker-compose.yml up -d. Suivez les logs avec docker logs -f docker-ragflow-cpu-1 et attendez la confirmation du démarrage avant de continuer.
- 5Ouvrez http://<IP-de-votre-serveur> dans un navigateur (RAGFlow écoute sur le port 80 par défaut), allez dans Model providers, et ajoutez la clé API ou le point de terminaison du LLM et du modèle d'embedding que vous comptez utiliser.
- 6Créez un dataset, choisissez un modèle d'embedding et une méthode de découpage, importez vos fichiers et cliquez sur le bouton play pour les analyser — puis vérifiez les chunks obtenus et créez un chat lié à ce dataset pour commencer à poser des questions.
RAGFlow peut-il fonctionner sans connexion internet ?
RAGFlow lui-même fonctionne entièrement hors ligne une fois déployé, mais il a besoin d'un LLM pour générer des réponses. Pointez-le vers un serveur de modèle local (par exemple un endpoint compatible Ollama) plutôt qu'une API cloud pour garder tout le pipeline hors ligne — vérifiez les paramètres de fournisseur de modèle de RAGFlow pour connaître les endpoints locaux pris en charge.
De combien d'espace disque RAGFlow a-t-il réellement besoin ?
Le minimum documenté est de 50 Go libres, en plus de l'espace qu'occuperont vos documents indexés et les chunks/embeddings générés. Prévoyez davantage pour de grandes collections de documents, car RAGFlow stocke les chunks analysés et les embeddings en plus des fichiers source.
Pour qui RAGFlow est-il fait ?
La profondeur d'analyse documentaire de RAGFlow est un vrai atout pour des fichiers complexes, et un vrai coût — en complexité d'installation et en matériel — pour les équipes qui n'en ont pas besoin.
RAGFlow vs. Alternatives
Une vue côte à côte sur les critères que les acheteurs comparent réellement : interface, traitement documentaire et licence.
Outil | Interface | Analyse documentaire | Citations | Licence |
|---|---|---|---|---|
| RAGFlow | App web + constructeur d'agents | Sensible à la mise en page / tableaux & scans | Traçables jusqu'au chunk source | Apache 2.0 |
| Quivr | App web | Extraction de texte générique | Références sources | Open source |
| Dify | App web + constructeur de workflow | Générique (RAG est un module) | Références sources | Open source |
| LlamaIndex | Framework de code, pas d'UI | Configurable via vos propres loaders | À implémenter vous-même | MIT |
Erreurs fréquentes dans l'évaluation de RAGFlow
Ces erreurs viennent du fait de traiter RAGFlow comme un remplacement direct d'un outil plus simple, ou l'inverse — le sous-dimensionner puis en blâmer le logiciel.
Questions fréquentes
Qu'est-ce que RAGFlow ?
RAGFlow est un moteur RAG open source (Apache 2.0) développé par InfiniFlow, spécialisé dans la compréhension approfondie des documents. Un analyseur sensible à la mise en page extrait tableaux, figures et structure de documents complexes, et chaque réponse générée renvoie au chunk source exact dont elle provient.
RAGFlow est-il gratuit ?
Le déploiement auto-hébergé et open source est gratuit sous licence Apache 2.0. InfiniFlow propose aussi un cloud managé payant distinct (cloud.ragflow.io) pour les équipes préférant ne pas gérer leur propre infrastructure — c'est un produit distinct du logiciel gratuit auto-hébergé couvert par ce guide.
Sous quelle licence RAGFlow est-il publié ?
Apache License 2.0, qui autorise l'utilisation, la modification et la redistribution libres, y compris dans des produits commerciaux.
Comment fonctionne la fonctionnalité de citation de RAGFlow ?
Chaque réponse générée par RAGFlow inclut des références aux chunks précis dont elle est issue. L'interface permet de prévisualiser le passage cité dans le document original, pour vérifier la réponse par rapport à sa source réelle plutôt que de se fier au seul résumé.
Qu'est-ce qui différencie RAGFlow d'un outil RAG classique ?
La plupart des outils RAG convertissent un document en texte brut avant le découpage, ce qui perd la structure des tableaux, les notes de bas de page et la mise en page. RAGFlow analyse d'abord la mise en page — les tableaux restent des tableaux — ce qui compte spécifiquement pour des documents professionnels complexes comme des contrats scannés et des états financiers.
Quels formats de documents RAGFlow prend-il en charge ?
Word, Slides, Excel, TXT, images, copies scannées, données structurées et pages web, selon la documentation du projet. Vérifiez le dépôt GitHub actuel pour la liste complète et à jour des formats avant tout déploiement, car RAGFlow ajoute fréquemment la prise en charge de nouveaux formats.
Puis-je auto-héberger RAGFlow ?
Oui. RAGFlow se déploie via Docker et Docker Compose sur votre propre infrastructure. Le matériel minimum documenté est de 4 cœurs CPU, 16 Go de RAM et 50 Go d'espace disque libre.
Quelles sont les exigences matérielles pour auto-héberger RAGFlow ?
CPU avec 4 cœurs ou plus (x86), 16 Go de RAM ou plus, 50 Go d'espace disque libre ou plus, Docker 24.0.0 ou plus récent, et Docker Compose v2.26.1 ou plus récent, selon la documentation de démarrage de RAGFlow.
RAGFlow vs. LlamaIndex — lequel choisir ?
Choisissez LlamaIndex si vous avez besoin d'un pipeline de récupération entièrement personnalisé, construit en code, avec votre propre choix de base de données vectorielle et sans UI packagée. Choisissez RAGFlow si une application web prête à l'emploi avec une forte analyse documentaire couvre déjà vos besoins, sans écrire votre propre pipeline de récupération.
RAGFlow prend-il en charge les agents IA, pas seulement le RAG ?
Oui. Au-delà de la récupération documentaire, RAGFlow inclut un constructeur de workflow visuel pour enchaîner étapes de récupération, outils et raisonnement multi-étapes, ainsi qu'une prise en charge du Model Context Protocol (MCP) pour connecter des outils externes à un agent.
