MinerU 接入 RAG 与 Agent 工作流的方式总览
MinerU 是 OpenDataLab 开源的文档解析引擎,把 PDF、DOCX、PPTX、XLSX、图片、网页转成 LLM 可用的 Markdown 和 JSON(GitHub Star 约 8 万,官方 README),对外的集成面一共五类:MCP Server 接 AI 编码工具、原生集成七个主流 RAG 框架、REST API 加 Python/Go/TypeScript SDK 供程序调用、CLI 供脚本批处理、mineru.net 在线版供无代码使用。这篇文章按接入方式拆解各自的做法与选型。工具本身的定位与安装见MinerU 是什么和安装教程。
为什么文档解析质量决定 RAG 上限
RAG 管线的检索切块建立在干净的文档结构上,这是通用事实:切块按标题和段落边界切,表格按行列解析,公式按语义保留,检索命中率和生成准确率才有保障。解析环节丢掉的信息,后面靠换嵌入模型、调切块参数都补不回来。
用坏解析器的典型症状有三类:PDF 表格被拍平成乱序文本,问”第三季度营收”检索到的切块里数字和年份对不上;页眉页脚页码混进每个切块,检索时稀释相关度;双栏论文按坐标直抽,句子逐行交错,嵌入向量的语义完全失真。MinerU 的对策是输出按人类阅读顺序排列的 Markdown,自动去页眉页脚,表格转 HTML、公式转 LaTeX——把这些在解析层解决掉,切块层拿到的就是干净输入。转换质量的具体表现见PDF 转 Markdown 实战。
MCP Server 接入:把解析能力挂进 AI 工具
官方 README 给出 MCP Server 的三个已适配客户端:Cursor、Claude Desktop、Windsurf。接入后,编码或桌面助手里的 Agent 可以直接调用文档解析能力——让 Cursor 读一份本地 PDF 规格书再改代码,或在 Claude Desktop 里把财报解析成 Markdown 再追问细节。
MCP 配置的具体字段(服务名、启动命令、参数)以官方 MCP 文档为准,不同客户端的配置文件格式也不同,这里不抄写易过期的 JSON 片段。配置思路是通用的:在客户端的 MCP 服务器列表里登记 MinerU 服务,客户端启动时拉起进程或连上服务地址,解析工具即出现在 Agent 的工具清单里。MCP 服务器多了之后想统一管理网关,可以看AgentDock 是什么;Claude Code 里配置 MCP 的通用方法另见本站 AI Coding 分类的相关文章。
RAG 框架集成:七个框架的原生支持
官方 README 列出的原生集成框架覆盖了当前主流的 RAG 技术栈:
| 框架 | 定位 | 接入思路 |
|---|---|---|
| LangChain | Python 生态最通用的 LLM 应用框架 | 文档加载器对接,解析结果进切分与检索链 |
| LlamaIndex | 以数据索引见长的 RAG 框架 | Reader 对接,产出 Document/Node 索引 |
| RAGFlow | 深度文档理解的 RAG 引擎 | 解析服务对接其知识库入库流程 |
| RAG-Anything | 围绕多模态文档的 RAG 方案 | 与 MinerU 解析输出深度绑定 |
| Flowise | 低代码 LLM 应用编排 | 节点化调用解析 API |
| Dify | 低代码 LLM 应用与工作流平台 | ETL 环节调 REST API,或用 MinerU 预处理语料后导入知识库 |
| FastGPT | 知识库问答平台 | 预解析语料批量导入 |
集成细节以各框架与 MinerU 官方文档为准,表内思路供评估接入成本用。以 Dify 为例,常见做法是解析跑在 MinerU 侧、知识库归 Dify 管:用脚本批量把 PDF 转成 Markdown,再走 Dify 的导入接口建库;想让这套流程跑在自托管环境里,可参考DeepSeek 加 Dify 的本地部署。RAG-Anything 是列表里最特殊的一个,它整个方案就建立在 MinerU 的解析输出之上,多模态文档的 RAG 可以优先评估。
REST API 与 SDK 接入
程序化接入走四条通道:REST API、Python/Go/TypeScript SDK、CLI、Docker。3.0 起 MinerU 的服务端是 mineru-api,两类端点(官方 Changelog):异步任务端点 POST /tasks,提交任务、查状态、取结果三步走,适合批处理;同步解析端点 POST /file_parse,向后兼容旧插件,适合单文件即时解析。
| 通道 | 适用场景 | 要点 |
|---|---|---|
REST API POST /tasks | 批量异步解析 | 提交后轮询状态,结果落盘后取回 |
REST API POST /file_parse | 单文件同步解析 | 请求即返回,兼容旧插件 |
| Python / Go / TypeScript SDK | 应用内嵌解析能力 | 语言原生调用,免手写 HTTP |
| CLI(mineru 命令) | 脚本与定时任务 | 未指定 —api-url 时自动拉起本地服务 |
| mineru-router | 多机多 GPU 集群 | 统一入口,接口与 mineru-api 兼容,自带任务负载均衡 |
请求参数、鉴权与返回结构以官方 API 文档为准。工程建议:批量入库一律走异步任务端点,同步端点留给交互式场景;任务规模上去后用 router 把负载摊到多卡,避免单卡排队。
三种后端在解析管线里的选型
后端选型是 RAG 管线里影响成本与质量的第一个决策(以下为工程建议,基准数字出自官方 README):
| 后端 | RAG 管线里的角色 | 依据 |
|---|---|---|
| pipeline | 批量预处理主力 | 快而稳、无幻觉、纯 CPU 可跑;OmniDocBench v1.6 得分 86.47 |
| hybrid-engine | 复杂版面兜底 | 精度 95.39(high)/ 95.26(medium),medium 快 35%~220% 但不支持图片分析 |
| vlm *-http-client | 对接已有推理服务 | 走 vLLM、SGLang、LMDeploy 等兼容 OpenAI 的服务端,最低 2GB 显存且 CPU 可跑 |
经验路径是两级:全量文档先过 pipeline,扫一遍入库;对检索效果明显差的版面(多栏论文、嵌套表格多的财报)单独用 hybrid 的 medium 档重解析。vlm 后端支持 vLLM、LMDeploy、mlx 生态(官方 README),团队已有推理集群时,http-client 模式让解析节点不占训练卡的显存预算。
国产化与私有化部署
信创环境是 MinerU 的另一块主场。官方口径的国产芯片适配覆盖十家:昇腾(Ascend)、寒武纪(Cambricon)、燧原(Enflame)、沐曦(MetaX)、摩尔线程(Moore Threads)、昆仑芯(Kunlunxin)、天数智芯、海光(Hygon)、壁仞(Biren)、平头哥(T-Head),部署形态支持私有化全离线运行(官方 README)。对涉密单位、金融机构和有数据出境约束的企业,文档不出内网的解析方案加上宽松许可证,构成了完整的落地条件;具体各芯片型号的支持矩阵以官方适配文档为准。
常见问题
mineru mcp 怎么配置?
MinerU 官方提供 MCP Server,适配 Cursor、Claude Desktop、Windsurf 三个客户端(官方 README),在客户端的 MCP 配置里登记 MinerU 服务后即可在对话中调用文档解析。具体配置字段以官方 MCP 文档为准,不同客户端格式略有差异。
mineru rag 接入哪个框架最省事?
LangChain 和 LlamaIndex 适合代码管线,Dify、FastGPT、Flowise 适合低代码场景,RAG-Anything 直接以 MinerU 解析输出为底座(官方 README)。通用做法是 MinerU 批量产出 Markdown 后导入知识库,框架选择跟着现有技术栈走。
mineru api 怎么调用?
3.0 起服务端为 mineru-api:批量任务走 POST /tasks 异步端点,单文件走 POST /file_parse 同步端点(官方 Changelog),另有 Python、Go、TypeScript SDK 封装。参数与返回结构以官方 API 文档为准,CLI 用户不指定 —api-url 时会自动启动本地服务。