跳到主内容
AIHO 2026 全新改版上线
TOOL · AGENT #07/11Agent 平台
RAGFlow

RAGFlow

开源 RAG 引擎,深度文档解析 + 高召回率

agent-platformopensourceragdocument-parsingself-host
访问官网
能力
4
易用
3
性价比
5
中文
4
稳定
3
编辑结论 综合3.8/ 5

需要精准文档解析和高召回率 RAG 的企业场景首选,深度文档解析(复杂表格/版面/OCR)+ 引用溯源能力在开源 RAG 引擎中最强,中国团队出品中文支持好,但部署资源要求高、Agent 能力弱、UI 仍需打磨。

01 / 02深度解读

TL;DR

RAGFlow 是 InfiniFlow(中国团队)出品的开源 RAG 引擎(Apache 2.0),核心卖点是深度文档解析 + 高召回率切片 + 引用溯源。支持 PDF / Word / Excel / PPT / 图片 / 扫描件,内置 OCR + 版面分析 + 表格识别,切片质量远超通用 RAG 方案。Docker 自托管 + Cloud 云端,中文支持好(文档 / UI / 社区)。

适合:需要精准文档问答的企业知识库、复杂文档(表格 / 图文 / 扫描件)场景、中文 RAG 需求、对召回率要求高的业务。不适合:需要复杂 Agent 编排(用 Dify)、资源有限的小服务器、需要精美 UI 的 C 端产品。

核心能力

  • 深度文档解析:PDF / Word / Excel / PPT / 图片 / 扫描件,版面分析 + 表格识别
  • OCR 引擎:内置 PaddleOCR / DeepDOC,支持中英文扫描件识别
  • 智能切片:基于版面分析的语义切片,保留段落 / 表格 / 标题结构
  • 高召回率:混合检索(全文 + 向量)+ 重排序(Rerank),召回精度高
  • 引用溯源:回答标注来源文档 + 页码 + 原文片段,可验证
  • 多模型接入:OpenAI / Claude / Ollama / 通义千问 / 智谱 / 月之暗面
  • 多向量数据库:Elasticsearch / Infinity(自研)/ Chroma
  • 知识库管理:多知识库 + 文档分类 + 解析状态监控
  • API 接口:完整 REST API + SDK,可集成到外部系统

价格

方案价格核心功能
开源版$0完整功能,Apache 2.0,自托管
Cloud按量付费托管服务,免运维
Enterprise联系销售私有部署 + 技术支持 + 定制

价格信息基于 2026-07 官网,可能调整。

体验与评测(资料整理)

说明:本节基于官方文档与公开评测整理,非本站独立实测环境,具体数据请以官方为准。 亮点:

  • 文档解析质量在开源 RAG 中最强——复杂表格、多栏排版、图文混排都能正确识别
  • 扫描件 OCR 效果好,中文印刷体识别准确率高
  • 引用溯源到页码 + 原文片段,回答可信度高
  • 混合检索 + Rerank 召回精度明显优于纯向量检索
  • 中国团队出品,中文文档和社区支持好,Issue 响应快
  • 支持通义千问 / 智谱 / 月之暗面等国产模型,国内场景适配好

踩坑:

  • 资源消耗大——Elasticsearch + Redis + MinIO + RAGFlow 本身,至少 16GB 内存
  • 部署较重,Docker Compose 起来 5+ 容器,配置复杂
  • 大文件解析慢——100 页 PDF 解析 + 切片可能 5-10 分钟
  • UI 仍有粗糙处,文档管理界面交互不够流畅
  • Agent 能力弱——RAG 问答是强项,复杂工具调用 / 多步推理不如 Dify
  • 解析失败的重试机制不完善,偶尔卡在 parsing 状态
  • 版本迭代快,升级需注意数据迁移

上手

  1. 系统准备:确保 16GB+ 内存 + Docker + Docker Compose
  2. 克隆仓库:git clone https://github.com/infiniflow/ragflow.git
  3. 启动服务:cd ragflow/docker && docker compose up -d
  4. 访问 http://localhost:80,注册管理员账号
  5. 配置模型:Settings → Model Providers 添加 LLM + Embedding + Rerank
  6. 创建知识库 → 上传文档 → 等待解析完成 → 开始问答

对比

维度RAGFlowDifyFastGPTAnythingLLM
文档解析✅ 最强
表格识别
OCR✅ 内置需配置需配置
召回精度
引用溯源✅ 页码+片段
Agent 能力基础
资源消耗
中文支持✅ 优秀一般

避坑

  • 资源一定要够:低于 16GB 内存别部署,ES + Redis + MinIO 都吃内存
  • Elasticsearch 配置:默认 JVM 堆偏小,大知识库调 ES_JAVA_OPTS 到 4-8GB
  • 大文件拆分上传:超过 100 页的 PDF 拆成小文件,解析更稳定
  • 解析失败检查格式:加密 PDF / 损坏文件会卡住,上传前检查
  • Rerank 模型别省:召回精度提升的关键,用 bge-reranker 或 Cohere Rerank
  • 不要当 Agent 平台用:RAG 问答是核心,复杂工具调用上 Dify
  • 定期备份:ES 数据 + MinIO 文件,升级前完整快照

适合 / 不适合

  • ✅ 需要精准文档问答的企业知识库
  • ✅ 复杂文档(表格 / 图文 / 扫描件)RAG 场景
  • ✅ 中文 RAG 需求(国产模型 + 中文 OCR)
  • ✅ 对召回率和引用溯源要求高的业务
  • ✅ 有运维能力的团队私有化部署
  • ❌ 需要复杂 Agent 编排(用 Dify)
  • ❌ 资源有限的小服务器(至少 16GB 内存)
  • ❌ 需要精美 C 端 UI 的产品
  • ❌ 无运维能力的团队(用 Cloud 版或 FastGPT)
  • ❌ 纯英文简单文档场景(AnythingLLM 更轻量)

FAQ

Q: RAGFlow 和 Dify 怎么选? A: RAGFlow 专注 RAG——文档解析 + 检索精度 + 引用溯源是核心强项,适合文档密集型知识库。Dify 是完整 AI 应用平台——工作流 + Agent + RAG + API 管理,功能更全。纯文档问答选 RAGFlow,构建 AI 应用选 Dify,两者也可配合使用。

Q: 部署需要什么配置? A: 最低 16GB 内存 + 4 核 CPU + 50GB 磁盘。生产环境建议 32GB 内存 + 8 核 + SSD。Elasticsearch 是内存大户,知识库文档量大时 ES JVM 堆需 8GB+。如果资源有限,考虑用 Infinity(RAGFlow 自研向量库)替代 ES。

Q: 支持中文 OCR 吗? A: 支持。内置 PaddleOCR + DeepDOC 引擎,中文印刷体识别准确率高。手写体效果一般,复杂背景的扫描件建议预处理(去噪 / 矫正)后再上传。OCR 默认开启,可在解析模板中配置。

Q: 和 FastGPT 比 RAG 精度如何? A: 两者 RAG 精度都属第一梯队。RAGFlow 的优势在文档解析——复杂表格、多栏版面、图文混排的识别更准确,切片质量更高。FastGPT 的优势在工作流编排和知识库管理 UI 更成熟。文档解析要求高选 RAGFlow,流程管理要求高选 FastGPT。

相关阅读

AnythingLLM · Flowise · Langfuse

来源

本文的价格、版本号与性能数据均参考以下官方渠道整理,可能随时间变动,请以官方实时信息为准。

02 / 02类似工具推荐