Skip to main content
PromptQuorum
/고급 로컬 LLM/RAGFlow 리뷰 2026: 복잡한 문서 이해와 인용 추적 RAG 엔진
RAG & Document Chat

RAGFlow 리뷰 2026: 복잡한 문서 이해와 인용 추적 RAG 엔진

·읽는 시간 12분·Hans Kuepper 저 · PromptQuorum 창립자, 멀티 모델 AI 디스패치 도구 · PromptQuorum

RAGFlow는 깊이 있는 문서 이해를 중심으로 만들어진 무료 오픈소스(Apache 2.0) RAG 엔진입니다. 레이아웃 인식 파서가 복잡한 PDF와 스캔 파일에서 표, 그림, 구조를 추출하며, 생성되는 모든 답변은 그 출처가 된 정확한 청크로 연결됩니다.

대부분의 RAG 도구는 PDF를 분석하기도 전에 하나의 텍스트 덩어리로 평탄화해 표, 각주, 상호 참조를 모두 잃어버립니다. RAGFlow는 먼저 문서 레이아웃을 분석한 뒤, 정확한 출처 청크까지 추적 가능한 인용과 함께 질문에 답합니다.

RAGFlow 리뷰 2026: 복잡한 문서 이해와 인용 추적 RAG 엔진

핵심 요점

  • Apache 2.0 라이선스 — 무료로 셀프호스팅, 수정, 재배포 가능
  • 검색과 에이전트 기능을 결합한 오픈소스 RAG 엔진, InfiniFlow 개발
  • 깊이 있는 문서 이해: 레이아웃 인식 분석이 파일을 텍스트로 평탄화하는 대신 표·그림·구조를 추출
  • 근거 기반 인용: 모든 답변이 생성된 특정 청크로 연결되며 미리보기 제공
  • Docker로 셀프호스팅; 최소 사양은 CPU 4코어, RAM 16GB, 디스크 50GB
  • 문서 중심 워크플로(계약서, 재무제표, 스캔 보고서)에 최적; 단순 텍스트 질의응답에는 더 가벼운 도구로 충분
  • 셀프호스팅을 원하지 않는 팀을 위한 유료 관리형 클라우드(cloud.ragflow.io)도 존재 — 이 리뷰는 셀프호스팅 오픈소스 배포를 다룹니다

📍 한 문장으로

RAGFlow는 복잡한 PDF, 표, 스캔 파일에 대한 레이아웃 인식 분석을 통해 깊이 있는 문서 이해에 특화된 오픈소스(Apache 2.0) 셀프호스팅 RAG 엔진이며, 답변은 정확한 출처 청크까지 추적됩니다.

💬 쉽게 말하면

RAGFlow는 PDF를 하나의 긴 텍스트 문자열로 다루는 대신 레이아웃을 읽어냅니다. 표는 표로 유지되고 각주는 해당 페이지에 계속 연결되며, 질문에 답하기 위해 문서의 어느 부분을 사용했는지 정확히 보여줍니다.

RAGFlow란?

RAGFlow(github.com/infiniflow/ragflow)는 InfiniFlow가 개발하고 Apache 2.0 라이선스로 공개한 오픈소스 RAG 엔진입니다. 공식 문서는 이를 검색 증강 생성과 에이전트 기능을 결합해 LLM을 위한 컨텍스트 레이어를 만드는 것으로 설명합니다 — 실제로는 문서 질의응답 시스템과 에이전트 워크플로를 구축할 수 있는 웹 인터페이스를 갖춘 셀프호스팅 애플리케이션입니다.

  • 깊이 있는 문서 이해: 레이아웃 인식 분석 파이프라인(DeepDoc)이 모든 파일을 단순 텍스트로 취급하는 대신 복잡한 파일 형식에서 텍스트, 표, 그림을 추출
  • RAGFlow 스스로 "설명 가능"하다고 표현하는 템플릿 기반 지능형 청킹 — 인덱싱 전에 문서가 어떻게 분할되었는지 확인하고 조정 가능
  • 출처 청크 미리보기가 포함된 근거 기반 인용으로, 답변을 정확한 원문 구절과 대조 확인 가능
  • 에이전트 기능: 검색·도구·다단계 추론을 연결하는 시각적 워크플로 빌더와 Model Context Protocol(MCP) 지원
  • Word, Slides, Excel, TXT, 이미지, 스캔본, 구조화된 데이터, 웹페이지 등을 소스 문서로 지원
  • Docker를 통해 셀프호스팅 배포 가능, 또는 직접 인프라를 운영하고 싶지 않다면 InfiniFlow의 유료 관리형 클라우드(cloud.ragflow.io) 이용 가능

깊이 있는 문서 이해와 인용 — RAGFlow의 핵심 차별점

문서가 깔끔한 텍스트 파일이라면 단순 RAG는 쉽습니다. 하지만 비즈니스 문서는 그런 경우가 드뭅니다 — 계약서에는 중첩된 표, 각주, 헤더, 스캔된 페이지, 상호 참조가 포함될 수 있으며, 단순한 PDF-텍스트 변환은 이 모든 것을 구조 없는 덩어리로 뭉개버립니다. RAGFlow는 이 구조를 버리지 않고 분석하도록 특별히 설계되었습니다.

📌참고: RAGFlow는 핵심 문서 파이프라인 외에도 GraphRAG 방식의 지식 그래프 구축과 조정 가능한 에이전트형 추론 깊이도 지원합니다 — 기본적인 문서 질의응답에 반드시 필요하다고 가정하기보다 자신의 사용 사례에 맞춰 평가하세요.

RAGFlow는 Quivr, Dify, LlamaIndex와 어떻게 다른가?

네 도구 모두 검색 증강 생성을 다루지만 해결하는 문제는 다릅니다. RAGFlow는 벡터 데이터베이스나 코드 프레임워크가 아니라 Quivr 같은 즉시 사용 가능한 문서 질의응답 애플리케이션과 비교 평가해야 합니다 — 이들은 "내 문서를 가리키고 질문하기"라는 동일한 구매 결정을 두고 경쟁합니다.

RAGFlow를 어떻게 셀프호스팅하나요?

RAGFlow는 Docker를 통해 배포됩니다. 다음은 이 리뷰 작성 시점 기준 프로젝트 공식 퀵스타트 가이드에 문서화된 단계입니다 — 배포 전에는 항상 저장소 문서에서 최신 릴리스 태그를 확인하세요.

  1. 1
    최소 사양 충족 여부를 확인하세요: CPU 4코어 이상(x86), RAM 16GB 이상, 여유 디스크 50GB 이상, Docker 24.0.0 이상, Docker Compose v2.26.1 이상.
  2. 2
    Linux에서는 내장 검색 컴포넌트를 위해 커널 메모리 맵 한도를 높이세요: sudo sysctl -w vm.max_map_count=262144를 실행한 후, 재부팅 후에도 유지되도록 /etc/sysctl.conf에 vm.max_map_count=262144를 추가하세요.
  3. 3
    저장소를 클론하고 안정 릴리스 태그로 체크아웃하세요: git clone https://github.com/infiniflow/ragflow.git 실행 후 cd ragflow/docker && git checkout -f v0.27.1 (배포 시점에 최신인 태그를 사용).
  4. 4
    스택을 시작하세요: docker compose -f docker-compose.yml up -d. docker logs -f docker-ragflow-cpu-1로 로그를 확인하며 성공적인 시작 메시지를 기다린 후 다음 단계로 진행하세요.
  5. 5
    브라우저에서 http://<서버 IP>를 여세요(RAGFlow는 기본적으로 포트 80에서 대기), Model providers로 이동해 사용할 LLM과 임베딩 모델의 API 키 또는 엔드포인트를 추가하세요.
  6. 6
    데이터셋을 생성하고 임베딩 모델과 청킹 방식을 선택한 뒤 파일을 업로드하고 재생 버튼을 눌러 분석하세요 — 그런 다음 생성된 청크를 검토하고 해당 데이터셋에 연결된 채팅을 만들어 질문을 시작하세요.

RAGFlow는 인터넷 연결 없이 실행할 수 있나요?

RAGFlow 자체는 배포 후 완전히 오프라인으로 실행되지만, 답변을 생성하려면 LLM이 필요합니다. 전체 파이프라인을 오프라인으로 유지하려면 클라우드 API 대신 로컬 모델 서버(예: Ollama 호환 엔드포인트)를 지정하세요 — 지원되는 로컬 엔드포인트는 RAGFlow의 모델 제공자 설정에서 확인할 수 있습니다.

RAGFlow는 실제로 얼마나 많은 디스크 공간이 필요한가요?

문서화된 최소 요구사항은 여유 공간 50GB이며, 이는 인덱싱된 문서와 생성되는 청크/임베딩이 차지하는 공간과는 별도입니다. RAGFlow는 원본 파일 외에 분석된 청크와 임베딩도 저장하므로 대규모 문서 컬렉션에는 더 많은 여유 공간을 확보하세요.

RAGFlow는 누구에게 적합한가?

RAGFlow의 문서 분석 깊이는 복잡한 파일에는 실질적인 강점이지만, 그것이 필요 없는 팀에게는 설치 복잡성과 하드웨어 측면에서 실질적인 비용입니다.

RAGFlow vs. 대안

구매자가 실제로 비교하는 기준 — 인터페이스, 문서 처리, 라이선스 — 에 따른 나란히 비교.

도구
인터페이스
문서 분석
인용
라이선스
RAGFlow웹 앱 + 시각적 에이전트 빌더레이아웃 인식 / 표·스캔본 대응출처 청크까지 추적 가능Apache 2.0
Quivr웹 앱범용 텍스트 추출출처 참조오픈소스
Dify웹 앱 + 워크플로 빌더범용(RAG는 하나의 모듈)출처 참조오픈소스
LlamaIndex코드 프레임워크, UI 없음자체 로더로 구성 가능직접 구현MIT

RAGFlow 평가 시 흔한 실수

이러한 실수는 RAGFlow를 더 단순한 도구의 완전한 대체품으로 취급하거나, 반대로 사양을 부족하게 구성한 뒤 소프트웨어 탓을 하는 데서 비롯됩니다.

자주 묻는 질문

RAGFlow란 무엇인가요?

RAGFlow는 InfiniFlow가 개발한 오픈소스(Apache 2.0) RAG 엔진으로, 깊이 있는 문서 이해에 특화되어 있습니다. 레이아웃 인식 파서가 복잡한 문서에서 표, 그림, 구조를 추출하며, 생성되는 모든 답변은 그 출처가 된 정확한 청크로 연결됩니다.

RAGFlow는 무료인가요?

셀프호스팅 오픈소스 배포는 Apache 2.0 라이선스 하에 무료입니다. InfiniFlow는 자체 인프라를 운영하고 싶지 않은 팀을 위해 별도의 유료 관리형 클라우드(cloud.ragflow.io)도 제공합니다 — 이는 이 리뷰가 다루는 무료 셀프호스팅 소프트웨어와는 별개의 제품입니다.

RAGFlow는 어떤 라이선스로 공개되나요?

상업용 제품을 포함해 자유로운 사용, 수정, 재배포를 허용하는 Apache License 2.0입니다.

RAGFlow의 인용 기능은 어떻게 작동하나요?

RAGFlow가 생성하는 모든 답변에는 그 답변의 근거가 된 구체적인 청크에 대한 참조가 포함됩니다. 인터페이스에서는 원본 문서 내 인용된 구절을 미리볼 수 있어, 요약만 신뢰하는 대신 실제 출처와 대조해 답변을 검증할 수 있습니다.

RAGFlow는 일반적인 RAG 도구와 무엇이 다른가요?

대부분의 RAG 도구는 청킹 전에 문서를 순수 텍스트로 변환해 표 구조, 각주, 레이아웃을 잃습니다. RAGFlow는 먼저 레이아웃을 분석해 표는 표로 유지되며, 이는 스캔한 계약서나 재무제표 같은 복잡한 비즈니스 문서에서 특히 중요합니다.

RAGFlow는 어떤 문서 형식을 지원하나요?

프로젝트 공식 문서에 따르면 Word, Slides, Excel, TXT, 이미지, 스캔본, 구조화된 데이터, 웹페이지를 지원합니다. RAGFlow는 새로운 형식 지원을 자주 추가하므로 배포 전 현재 GitHub 저장소에서 완전하고 최신인 형식 목록을 확인하세요.

RAGFlow를 셀프호스팅할 수 있나요?

네. RAGFlow는 자체 인프라에서 Docker와 Docker Compose를 통해 배포됩니다. 문서화된 최소 하드웨어는 CPU 4코어, RAM 16GB, 여유 디스크 50GB입니다.

RAGFlow를 셀프호스팅하기 위한 하드웨어 요구사항은 무엇인가요?

RAGFlow 퀵스타트 문서에 따르면 CPU 4코어 이상(x86), RAM 16GB 이상, 여유 디스크 공간 50GB 이상, Docker 24.0.0 이상, Docker Compose v2.26.1 이상이 필요합니다.

RAGFlow vs. LlamaIndex — 어느 쪽을 사용해야 하나요?

코드로 구축하는 완전히 맞춤화된 검색 파이프라인이 필요하고, 벡터 데이터베이스를 직접 선택하며 패키지형 UI가 필요 없다면 LlamaIndex를 선택하세요. 강력한 문서 분석을 갖춘 즉시 사용 가능한 웹 애플리케이션이 이미 요구사항을 충족하고 직접 검색 파이프라인을 작성하고 싶지 않다면 RAGFlow를 선택하세요.

RAGFlow는 RAG뿐 아니라 AI 에이전트도 지원하나요?

네. 문서 검색을 넘어 RAGFlow는 검색 단계, 도구, 다단계 추론을 연결하는 시각적 워크플로 빌더와 외부 도구를 에이전트에 연결하기 위한 Model Context Protocol(MCP) 지원을 포함합니다.

출처

← 고급 로컬 LLM으로 돌아가기