Wichtigste Erkenntnisse
- Apache-2.0-Lizenz — kostenlos selbst hostbar, veränderbar und weiterverteilbar
- Entwickelt von InfiniFlow, einer Open-Source-RAG-Engine, die Retrieval mit Agenten-Fähigkeiten verbindet
- Tiefes Dokumentenverständnis: layoutbewusstes Parsing extrahiert Tabellen, Abbildungen und Struktur, statt eine Datei auf reinen Text zu reduzieren
- Nachvollziehbare Zitate: Jede Antwort verweist mit Vorschau auf den konkreten Chunk, aus dem sie generiert wurde
- Self-Hosting via Docker; Mindesthardware sind 4 CPU-Kerne, 16 GB RAM, 50 GB Speicher
- Am besten geeignet für dokumentenlastige Workflows (Verträge, Finanzberichte, gescannte Dokumente); für reine Text-Q&A genügt ein schlankeres Tool
- Eine kostenpflichtige, gehostete Cloud (cloud.ragflow.io) existiert ebenfalls für Teams ohne eigenes Hosting — dieser Test behandelt die selbst gehostete, quelloffene Bereitstellung
📍 In einem Satz
RAGFlow ist eine quelloffene (Apache 2.0), selbst gehostete RAG-Engine, spezialisiert auf tiefes Dokumentenverständnis — layoutbewusstes Parsing komplexer PDFs, Tabellen und gescannter Dateien —, deren Antworten sich bis zum exakten Quell-Chunk zurückverfolgen lassen.
💬 In einfachen Worten
Statt ein PDF als eine lange Textkette zu behandeln, liest RAGFlow dessen Layout — Tabellen bleiben Tabellen, Fußnoten bleiben ihrer Seite zugeordnet — und zeigt genau, welchen Ausschnitt des Dokuments es zur Beantwortung der Frage verwendet hat.
Was ist RAGFlow?
RAGFlow (github.com/infiniflow/ragflow) ist eine quelloffene RAG-Engine von InfiniFlow, veröffentlicht unter der Apache-2.0-Lizenz. Die eigene Dokumentation beschreibt sie als Verbindung von Retrieval-Augmented Generation mit Agenten-Fähigkeiten zu einer Kontextschicht für LLMs — in der Praxis eine selbst gehostete Anwendung mit Weboberfläche zum Aufbau von Dokumenten-Q&A-Systemen und agentischen Workflows.
- Tiefes Dokumentenverständnis: eine layoutbewusste Parsing-Pipeline (DeepDoc) extrahiert Text, Tabellen und Abbildungen aus komplexen Dateiformaten, statt jede Datei als flachen Text zu behandeln
- Template-basiertes, intelligentes Chunking, das RAGFlow selbst als "erklärbar" bezeichnet — Sie können vor der Indexierung sehen und anpassen, wie ein Dokument aufgeteilt wurde
- Nachvollziehbare Zitate mit Quell-Chunk-Vorschau, sodass eine Antwort gegen die exakte Textstelle geprüft werden kann, aus der sie stammt
- Agentische Fähigkeiten: ein visueller Workflow-Builder zum Verketten von Retrieval, Tools und mehrstufigem Reasoning, plus Unterstützung für das Model Context Protocol (MCP)
- Unterstützt Word, Slides, Excel, TXT, Bilder, gescannte Kopien, strukturierte Daten, Webseiten und mehr als Quelldokumente
- Bereitstellbar über Docker zum Self-Hosting oder über InfiniFlows kostenpflichtige gehostete Cloud (cloud.ragflow.io), falls Sie keine eigene Infrastruktur betreiben möchten
Tiefes Dokumentenverständnis & Zitate — das Kernmerkmal von RAGFlow
Einfaches RAG ist unkompliziert, wenn ein Dokument eine saubere Textdatei ist. Geschäftsdokumente sind das selten — ein Vertrag kann verschachtelte Tabellen, Fußnoten, Kopfzeilen, gescannte Seiten und Querverweise enthalten, und eine naive PDF-zu-Text-Konvertierung reduziert das alles zu einem unstrukturierten Datenblock. RAGFlow ist gezielt darauf ausgelegt, diese Struktur zu erhalten statt sie zu verwerfen.
📌Hinweis: RAGFlow unterstützt zusätzlich zur Kern-Dokumenten-Pipeline GraphRAG-artige Wissensgraphen und konfigurierbare Tiefe agentischen Reasonings — prüfen Sie diese anhand Ihres eigenen Anwendungsfalls, statt anzunehmen, dass Sie sie für einfaches Dokumenten-Q&A benötigen.
Wie unterscheidet sich RAGFlow von Quivr, Dify und LlamaIndex?
Alle vier Tools berühren Retrieval-Augmented Generation, lösen aber unterschiedliche Probleme. RAGFlow sollte gegen fertige Dokumenten-Q&A-Anwendungen wie Quivr bewertet werden, nicht gegen eine Vektordatenbank oder ein Code-Framework — sie konkurrieren um dieselbe Kaufentscheidung: "auf meine Dokumente zeigen und Fragen stellen".
Wie hostet man RAGFlow selbst?
RAGFlow wird über Docker bereitgestellt. Dies sind die dokumentierten Schritte aus dem offiziellen Quickstart-Guide des Projekts, aktuell zum Zeitpunkt dieses Tests — prüfen Sie vor dem Deployment stets die Doku des Repositories auf den neuesten Release-Tag.
- 1Prüfen Sie, ob Ihr System die Mindestanforderungen erfüllt: CPU mit 4+ Kernen (x86), 16 GB+ RAM, 50 GB+ freier Speicher, Docker 24.0.0+ und Docker Compose v2.26.1+.
- 2Erhöhen Sie unter Linux das Kernel-Limit für Memory-Maps für die integrierte Suchkomponente: sudo sysctl -w vm.max_map_count=262144, dann vm.max_map_count=262144 in /etc/sysctl.conf eintragen, damit es einen Neustart übersteht.
- 3Repository klonen und einen stabilen Release-Tag auschecken: git clone https://github.com/infiniflow/ragflow.git, dann cd ragflow/docker && git checkout -f v0.27.1 (verwenden Sie das jeweils aktuelle Tag zum Zeitpunkt Ihres Deployments).
- 4Stack starten: docker compose -f docker-compose.yml up -d. Logs mit docker logs -f docker-ragflow-cpu-1 beobachten und auf die Meldung eines erfolgreichen Starts warten, bevor Sie fortfahren.
- 5Öffnen Sie http://<Ihre-Server-IP> im Browser (RAGFlow läuft standardmäßig auf Port 80), gehen Sie zu Model providers und tragen Sie den API-Schlüssel bzw. Endpoint für das gewünschte LLM und Embedding-Modell ein.
- 6Erstellen Sie ein Dataset, wählen Sie Embedding-Modell und Chunking-Methode, laden Sie Ihre Dateien hoch und klicken Sie auf Play, um sie zu parsen — prüfen Sie danach die erzeugten Chunks und erstellen Sie einen Chat, der mit diesem Dataset verknüpft ist, um Fragen zu stellen.
Kann RAGFlow ohne Internetverbindung laufen?
RAGFlow selbst läuft nach dem Deployment vollständig offline, benötigt für Antworten aber ein LLM. Verweisen Sie auf einen lokalen Modellserver (z. B. einen Ollama-kompatiblen Endpoint) statt auf eine Cloud-API, um die gesamte Pipeline offline zu halten — prüfen Sie in den Model-Provider-Einstellungen von RAGFlow, welche lokalen Endpoints unterstützt werden.
Wie viel Speicherplatz benötigt RAGFlow tatsächlich?
Das dokumentierte Minimum sind 50 GB freier Speicher, zusätzlich zum Platz, den Ihre indexierten Dokumente und die daraus erzeugten Chunks/Embeddings belegen. Kalkulieren Sie bei großen Dokumentensammlungen entsprechend mehr ein, da RAGFlow geparste Chunks und Embeddings zusätzlich zu den Quelldateien speichert.
Für wen eignet sich RAGFlow?
Die Parsing-Tiefe von RAGFlow ist ein echter Vorteil bei unübersichtlichen Dateien und ein echter Kostenfaktor — in Setup-Komplexität und Hardware — für Teams, die sie nicht brauchen.
RAGFlow vs. Alternativen
Eine Gegenüberstellung anhand der Kriterien, die Käufer tatsächlich vergleichen: Oberfläche, Dokumentenverarbeitung und Lizenz.
Tool | Oberfläche | Dokumenten-Parsing | Zitate | Lizenz |
|---|---|---|---|---|
| RAGFlow | Web-App + visueller Agent-Builder | Layoutbewusst / Tabellen & Scans | Nachvollziehbar bis Quell-Chunk | Apache 2.0 |
| Quivr | Web-App | Allgemeine Textextraktion | Quellverweise | Open Source |
| Dify | Web-App + Workflow-Builder | Allgemein (RAG ist ein Modul) | Quellverweise | Open Source |
| LlamaIndex | Code-Framework, keine UI | Konfigurierbar über eigene Loader | Selbst implementieren | MIT |
Häufige Fehler bei der Bewertung von RAGFlow
Diese Fehler entstehen, wenn RAGFlow als 1:1-Ersatz für ein einfacheres Tool behandelt wird — oder umgekehrt, wenn es unterdimensioniert betrieben wird und man der Software die Schuld gibt.
Häufig gestellte Fragen
Was ist RAGFlow?
RAGFlow ist eine quelloffene (Apache 2.0) RAG-Engine von InfiniFlow, spezialisiert auf tiefes Dokumentenverständnis. Ein layoutbewusster Parser extrahiert Tabellen, Abbildungen und Struktur aus komplexen Dokumenten, und jede generierte Antwort verweist auf den exakten Quell-Chunk, aus dem sie stammt.
Ist RAGFlow kostenlos?
Die selbst gehostete, quelloffene Bereitstellung ist unter der Apache-2.0-Lizenz kostenlos. InfiniFlow bietet zusätzlich eine separate, kostenpflichtige gehostete Cloud (cloud.ragflow.io) für Teams ohne eigene Infrastruktur — das ist ein eigenständiges Produkt, getrennt von der kostenlosen Self-Hosting-Software, die dieser Test behandelt.
Unter welcher Lizenz steht RAGFlow?
Apache License 2.0, die freie Nutzung, Veränderung und Weiterverbreitung erlaubt, auch in kommerziellen Produkten.
Wie funktioniert das Zitat-Feature von RAGFlow?
Jede von RAGFlow generierte Antwort enthält Verweise auf die konkreten Chunks, aus denen sie erstellt wurde. Die Oberfläche erlaubt eine Vorschau der zitierten Textstelle im Originaldokument, sodass Sie die Antwort gegen ihre tatsächliche Quelle prüfen können, statt der Zusammenfassung allein zu vertrauen.
Was unterscheidet RAGFlow von einem typischen RAG-Tool?
Die meisten RAG-Tools wandeln ein Dokument vor dem Chunking in reinen Text um, wodurch Tabellenstruktur, Fußnoten und Layout verloren gehen. RAGFlow analysiert zuerst das Layout — Tabellen bleiben Tabellen —, was besonders bei komplexen Geschäftsdokumenten wie gescannten Verträgen und Finanzberichten zählt.
Welche Dokumentenformate unterstützt RAGFlow?
Laut Projektdokumentation Word, Slides, Excel, TXT, Bilder, gescannte Kopien, strukturierte Daten und Webseiten. Prüfen Sie vor dem Deployment das aktuelle GitHub-Repository auf die vollständige, aktuelle Formatliste, da RAGFlow häufig neue Formatunterstützung nachliefert.
Kann ich RAGFlow selbst hosten?
Ja. RAGFlow wird über Docker und Docker Compose auf Ihrer eigenen Infrastruktur bereitgestellt. Die dokumentierte Mindesthardware sind 4 CPU-Kerne, 16 GB RAM und 50 GB freier Speicher.
Welche Hardware-Anforderungen hat RAGFlow für Self-Hosting?
CPU mit 4 oder mehr Kernen (x86), 16 GB oder mehr RAM, 50 GB oder mehr freier Speicherplatz, Docker 24.0.0 oder neuer, sowie Docker Compose v2.26.1 oder neuer, laut der Quickstart-Dokumentation von RAGFlow.
RAGFlow vs. LlamaIndex — was sollte ich verwenden?
Wählen Sie LlamaIndex, wenn Sie eine vollständig individuelle, im Code aufgebaute Retrieval-Pipeline mit eigener Vektordatenbank-Wahl und ohne fertige UI benötigen. Wählen Sie RAGFlow, wenn eine fertige Web-Anwendung mit starkem Dokumenten-Parsing Ihre Anforderungen bereits abdeckt, ohne eine eigene Retrieval-Pipeline zu schreiben.
Unterstützt RAGFlow KI-Agenten, nicht nur RAG?
Ja. Über Dokumenten-Retrieval hinaus enthält RAGFlow einen visuellen Workflow-Builder zum Verketten von Retrieval-Schritten, Tools und mehrstufigem Reasoning, sowie Unterstützung für das Model Context Protocol (MCP) zur Anbindung externer Tools an einen Agenten.
Muss ich bei RAGFlow die DSGVO beachten?
Bei Self-Hosting auf eigener Infrastruktur in der EU/DACH-Region verarbeiten Sie Dokumente und deren Embeddings selbst, was Artikel 28 DSGVO (Auftragsverarbeitung) vereinfacht, solange keine externen LLM- oder Embedding-APIs außerhalb der EU eingebunden werden. Prüfen Sie zusätzlich, welches LLM Sie an RAGFlow anbinden — die DSGVO-Bewertung hängt von diesem Modellanbieter ab, nicht nur von RAGFlow selbst. Dies ist keine Rechtsberatung; lassen Sie die konkrete datenschutzrechtliche Einordnung für Ihren Anwendungsfall von einem Datenschutzbeauftragten oder einer Kanzlei prüfen.
Ist RAGFlow für den deutschen Mittelstand geeignet?
Für Teams mit dokumentenlastigen, strukturierten Unterlagen — etwa Verträge, Rechnungen, technische Dokumentation — ja, sofern die Hardware-Mindestanforderungen (16 GB+ RAM) verfügbar sind. Für einfache interne Notizen ohne komplexe Struktur ist ein leichteres Tool meist die pragmatischere Wahl.
