
你花了一整个下午,从 PDF 里复制表格。
粘贴到 Excel。乱了。再复制一次。格式飞了。公式变成了乱码。图片不见了。
如果有 200 页。或者 500 份文档,那你要怎么处理?
这就是 MinerU 要干掉的事。
一个曼哈顿律师收到 500 页合同,每条都需要可搜索——手动处理,一周。芝加哥会计收到 200 份扫描发票,每个数字都得进表格——四天。斯坦福研究员有 50 篇论文,表格公式图表全锁在 PDF 里——两周。
他们都在为复制粘贴浪费生命。
然后他们遇到了 MinerU。律师:4 分钟。会计:12 分钟。研究员:一个周日下午写完文献综述。
这工具哪来的
MinerU 是上海人工智能实验室 OpenDataLab 团队的作品。
起初,他们只是需要从海量科学文档中提取干净文本,用来训练大语言模型。市面上的工具全都不行——要么丢表格,要么吞公式,要么在扫描件面前直接摆烂。他们干脆自己造了一个。然后开源了。
现在这个项目在 GitHub 上拿了69,000 多颗星,5800+fork,4 篇 arXiv 技术报告,从 v1.0 一路迭代到 v3.4——最近一次更新是 2026 年 6 月 18 日,OCR 引擎刚升级到 PP-OCRv6,识别精度又涨了 11%,速度翻了一倍。
重点:这是一个用"训练大模型"的标准来要求自己的文档解析工具——精度和速度是它的第一性原理,不是附加卖点。
它到底能做什么
一句话:把任何文档变成 AI 能读的数据。
输入什么?PDF、Word、PPT、Excel、图片、网页 URL,随便给。
输出什么?干净的 Markdown、JSON、LaTeX。表格自动变 HTML,公式自动变 LaTeX,图片自动提取并配上描述。
说几个别的工具搞不定的:
多栏排版。PDF 里那种学术论文常见的双栏布局,普通工具从左到右横跨两栏一顿乱读。MinerU 在一栏内从上到下读完,再跳下一栏——跟人眼一样。这对 RAG 应用来说,是天壤之别。
跨页表格。一份表格跨了三页?MinerU 能把它们拼回来。合并单元格、多行标题,全部保留。
扫描件 OCR。把 1995 年打印页面的照片扔进去,出来的是干净文本。109 种语言,手写体也能认。
万页文档。滑动窗口处理,内存峰值可控。一万页的 PDF 不用手动拆。
批量模式。指向一个装了 500 份文档的文件夹,然后去喝咖啡。
OmniDocBench v1.6 评测上,MinerU 的 hybrid 引擎综合精度到了95.39 分。pipeline 引擎(CPU 也能跑)也拿了 86.47 分。跟同行比是什么水平?Adobe Acrobat Pro 收你 239.88 美元一年,表格照样丢。ABBYY FineReader 165 美元一年,公式还是不行。Mistral OCR 每 1000 页收你 2 美元,账单永不停。
MinerU:0 美元。数据不出你的电脑。
三步跑起来
先说最简单的路径。
第一步:安装
打开终端,一行命令:
uv pip install -U "mineru[all]" -i https://mirrors.aliyun.com/pypi/simple
这行的目的是把 MinerU 和它所有依赖一次性装好。用了阿里云镜像,国内用户不用折腾网络。
需要 Python 3.10-3.13。Windows 用户注意——Python 3.13 暂时不行(ray 还没适配),用 3.10-3.12。
这里最容易出错:Windows 上的 CUDA 加速配置。如果装完 GPU 跑不起来,去官方 FAQ 搜 "Windows CUDA acceleration"——那页写得很清楚。
第二步:跑第一份文档
装好之后,只需要知道一个命令:
mineru -p <你的文件或文件夹路径> -o <输出目录>
这步在做的事:mineru 会自动下载需要的模型文件(第一次用的时候),然后解析你给的所有文档。模型文件存在本地,下次直接用,不重复下载。
如果下载模型时卡住了(懂的都懂,HuggingFace),先设一下环境变量:
export MINERU_MODEL_SOURCE=modelscope
这会切到 ModelScope 去下载,国内用户秒下。
第三步:确认结果
打开输出目录,你会看到 Markdown 文件。打开看看——表格在,公式在,段落顺序对,图片也提出来了。
配好之后,每次使用只需做一件事:敲mineru -p <文件> -o <输出>。
想折腾的话,官方还提供了 Docker 部署和源码安装两种方式——跑通了再考虑。
装好了,怎么用
日常最常用的就这几个:
mineru 命令行:单文件或批量,一行搞定。这是最常用的姿势。
mineru -p ./contracts/ -o ./output/
-b 参数选引擎:pipeline 引擎 CPU 也能跑,速度快、零幻觉,日常用最稳。hybrid 引擎精度最高但需要 GPU。
mineru -p doc.pdf -o ./out -b pipeline
Python SDK:五行代码嵌入你的脚本。适合需要自动化的场景。
from mineru import MinerUparser = MinerU(backend="pipeline")result = parser.parse("document.pdf")result.save_markdown("./output/")
Web 界面:去 mineru.net,上传、点击、下载。连安装都不用。
重点:新手无脑用 pipeline 引擎+mineru命令。先跑通,再折腾。
目前 MinerU 已经可以接入 Claude Desktop、Cursor、Windsurf、LangChain、LlamaIndex、RAGFlow、Dify、FastGPT——把你的文档直接喂给 AI Agent。还支持 MCP 协议,可以在 Claude Code 里直接调用。
MinerU 真正适合的人是那些每周跟文档打交道、复制粘贴复制粘贴、已经忍了很久的人。你给它一堆乱七八糟的 PDF/Word/PPT/扫描件,它给你干净的结构化文本。它不是玩具,是产线工具。
参考链接:[1] MinerU GitHub:https://github.com/opendatalab/MinerU[2] MinerU 官网:https://mineru.net/
点赞、转发、小心心❤️如果你也在跟 PDF 表格搏斗过,评论区说说你的血泪史——
— 完 —
免责与版权声明:本文资讯及观点仅供技术交流参考。文中引用图片均源于网络公开渠道(如官方博客、社交平台等),著作权归原作者所有。本文旨在分享与评述技术进展,符合“合理使用”原则。如相关图片/内容涉及版权侵权,请联系我们(留言或私信),我们将核实后立即删除。