MinerU 的 PDF 转 Markdown 是什么效果
MinerU 把 PDF、DOCX、PPTX、XLSX、图片、网页六类输入转成 Markdown 和 JSON,公式输出 LaTeX、表格输出 HTML,扫描件和手写内容走 OCR,输出按人类阅读顺序排列并自动去掉页眉页脚(以上能力出自官方 README)。它是 OpenDataLab 出品的开源项目,GitHub Star 约 8 万(2026 年 9 月),这篇文章按内容类型拆解转换效果,并给一份可执行的质检清单。环境还没装好的先看MinerU 安装教程,本文只谈转换本身。
命令行调用就一行,装好后即可复现文中所有效果:
mineru -p <input_path> -o <output_path>
输入与输出:六类输入,多种产物
输入侧覆盖六类文件:PDF、DOCX、PPTX、XLSX、图片、网页,其中 DOCX、PPTX、XLSX 是 3.1.0 起的原生解析,不再先转 PDF 再解析——官方 Changelog 给出的对比数据是端到端提速数十倍。输出侧不止 Markdown 一种,按用途选:
| 输出物 | 用途 |
|---|---|
| 多模态 Markdown | 含图片引用、表格 HTML、公式 LaTeX,适合 RAG 入库和发布 |
| NLP Markdown | 纯文本倾向,适合切块训练语料 |
| 按阅读顺序排序的 JSON | 带结构信息,适合程序化处理 |
| 版面与 span 可视化 | 人工核对解析质量的证据 |
给 RAG 用就选多模态 Markdown;要写脚本后处理,JSON 比正则解析 Markdown 稳得多。
表格:转 HTML、跨页合并、表格里嵌图嵌公式
表格是 PDF 转 Markdown 最容易翻车的环节,MinerU 的处理方式有三层。第一层,表格转 HTML 而非 Markdown 表格——HTML 能表达合并单元格与复杂嵌套,Markdown 表格语法表达不了,这是正确的工程取舍。第二层,跨页表格合并:长表格跨页断裂后自动接回一张表,3.1.0 起支持(官方 Changelog)。第三层,3.0.0 起支持解析表格内部的图片与公式,财报、实验报告里”表格单元格里放图表”的场景不再丢内容。
验收表格质量看两点:行列数与原表对不对得上,合并单元格的层级有没有保住。行列对但内容错位的表,多半是版面检测把两个相邻表格粘在了一起。
公式:转 LaTeX,行间公式带编号
公式自动识别并转 LaTeX 是 MinerU 的看家能力,项目最初就是为解决科学文献符号转换问题而生(官方 README)。3.0.0 起支持行间公式编号识别,论文里”(3)“这类编号不再丢。转出来的 LaTeX 可以直接进支持 MathJax 或 KaTeX 的渲染器验证,渲染不出来的公式基本就是识别出了错,肉眼比对原 PDF 即可定位。数学、物理类文献是公式识别的重灾区,建议这类文档优先用精度更高的 VLM 后端而不是 pipeline。
扫描件、手写与复杂版式:OCR 路线
扫描件不需要特殊开关:MinerU 自动检测扫描版和乱码 PDF 并启用 OCR(官方 README),OCR 支持 109 种语言。手写内容、多栏版式、竖排文本、印章文字在 3.0.0 起陆续支持(官方 Changelog),合同、公文、档案这类”非印刷体密集”的文档是主要受益者。
OCR 模型在 3.4(2026-06-18)升级为 PP-OCRv6:OmniDocBench v1.6 上 OCR 精度提升约 11%,OCR 处理速度提升约 100%(官方 Changelog)。同版本还做了一次简化:日语、繁体中文、英语、拉丁语系不再单列 OCR 语言选项,统一路由到 ch 模型,配置更省心。处理整册扫描档案时,速度翻倍意味着批处理窗口直接减半。
阅读顺序重建与页眉页脚清除
MinerU 输出符合人类阅读顺序的文本,兼容单栏、多栏和复杂版式,同时自动去除页眉、页脚、页码、脚注(官方 README)。这两件事对下游影响极大:多栏 PDF 若按坐标从左到右直抽,两栏文字会逐行交错成乱码;页眉页脚混进语料后,每次切块都带上”第 12 页”这类噪声,检索时稀释相关度。3.1.0 还加了截断段落合并,跨页断开的句子自动接续。抽查阅读顺序的办法很直接:找一份双栏文档,看标题、正文、图表说明在输出里的先后是否和肉眼看 PDF 一致。
后端与 effort 档位:效果和速度的权衡
后端选择直接决定同一份 PDF 的转换效果。官方 README 部署表给出的 OmniDocBench v1.6 端到端总分:pipeline 后端 86.47,hybrid 后端 95.39(high)/ 95.26(medium),vlm 后端 95.30。
hybrid 后端 3.3 起引入 effort 档位,默认 medium:相比 high,OmniDocBench v1.6 总分只低 0.13 分,速度提升 35%~220%,按平台细分是 Linux 约 80%(文本 PDF)/ 35%(OCR 场景),Windows 约 90% / 45%,macOS 约 220% / 50%(官方 Changelog)。medium 的唯一功能牺牲是不支持图片分析。工程建议:日常批量转换用默认 medium,需要图片分析或冲击最高精度时切 high;速度敏感、机器一般的批量任务用 pipeline。
批量任务另有两层保障(官方 Changelog,3.0.0):滑动窗口机制显著压低长文档解析的峰值内存,数万页文档不需要手动拆分;批量推理支持流式写盘,先完成的结果及时落盘,多线程并发推理也已线程安全。配合 mineru-router 做多 GPU 任务分发,长跑任务中断后重跑的代价小很多。
转换后的质检清单
批量转换前先抽检,这份清单按优先级排(工程建议,非官方要求):
- 表格行数:输出 HTML 表格的行数与原 PDF 对比,行列数错位最常见;
- 公式渲染:LaTeX 逐段过一遍 MathJax/KaTeX 渲染,渲染失败的即识别错误;
- 图片引用:Markdown 里的图片链接是否可访问、截图是否对应原文位置;
- 阅读顺序:双栏或多栏页抽查段落先后顺序;
- 版面可视化:核对版面检测框有没有把页眉误判为正文。
抽检通过后再放全量任务,比转完一万页再返工便宜得多。质量对比与选型问题见MinerU 对比同类工具,转换结果如何进 RAG 管线见MinerU 的 RAG 与 MCP 集成指南。
常见问题
mineru pdf 转 markdown 具体怎么操作?
安装 mineru 包后执行 mineru -p 输入路径 -o 输出路径 即可,输出目录里得到 Markdown、JSON 与可视化结果;无 GPU 加 -b pipeline 参数用 CPU 跑。不想装环境可以直接在 mineru.net 在线版上传 PDF 得到同样格式的结果。
PDF 转 Markdown 用什么工具好?
含扫描件、表格、公式的复杂文档,MinerU 这类版面解析引擎效果最稳;纯文本 PDF 用轻量库抽文本即可。MinerU 与 Marker、Docling、PaddleOCR 的定位差异见本站横评文章,选型核心看许可证、中文效果与部署形态。
mineru 对扫描件和手写的识别效果怎么样?
扫描件自动启用 OCR,支持 109 种语言与手写内容,3.4 版本换用 PP-OCRv6 后精度提升约 11%、速度提升约 100%(官方 Changelog)。手写、竖排、印章文字均支持,但识别质量依文档清晰度浮动,建议先拿自家样张在在线版试测。