news 2026/8/29 13:54:26

MinerU 实战指南:把 PDF 与 Office 文档一次性转为 Markdown 和 JSON

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MinerU 实战指南:把 PDF 与 Office 文档一次性转为 Markdown 和 JSON

MinerU 实战指南:把 PDF 与 Office 文档一次性转为 Markdown 和 JSON

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

MinerU 是一个开源文档解析工具,把 PDF、DOCX、PPTX、XLSX 和图片文件转换成 Markdown、JSON 这类机器可读的格式,供检索、抽取和大模型工作流使用。如果你的需求是 PDF 转 Markdown、给 RAG 知识库建语料,或者要把大量合同、报告文件批量结构化,它就是为这类场景设计的。纯 CPU 机器和 GPU 机器都能跑,兼容 Windows、Linux 和 macOS。

它解决什么问题

常见文本提取工具的产出往往不好直接用:多栏版面的阅读顺序会乱,表格和公式丢失或变成乱码,扫描版 PDF 根本没有文本层。MinerU 按阅读顺序输出文本,自动去掉页眉、页脚、页码,把表格转成 HTML、公式转成 LaTeX,并能自动识别扫描版和乱码 PDF 后启用 OCR,省掉了大部分后续人工整理。

安装 MinerU 并跑通第一次转换

安装走一条 pip 命令,mineru[all]包含全部核心功能:

uv pip install -U "mineru[all]" # 或者:pip install -U "mineru[all]"

需要改源码的话,从 https://gitcode.com/GitHub_Trending/mi/MinerU 克隆仓库,然后执行uv pip install -e .[all]即可。

装好后,第一次运行只需要一条命令。输入可以是单个文件,也可以是一个目录,支持 PDF、图片和 DOCX / PPTX / XLSX:

mineru -p demo/pdfs/demo1.pdf -o output

首次使用有两个注意点:

  • 首次运行会自动下载所需模型文件,之后直接复用本地缓存。如果网络访问不了 huggingface,先执行export MINERU_MODEL_SOURCE=modelscope切换到国内镜像源。
  • 机器没有 GPU 时,加上-b pipeline参数,pipeline 后端支持纯 CPU 环境推理。

上图是 MinerU 解析流程的全景:一份文件经过预处理、版面与公式检测、坐标修复和段落合并等管线处理,最后以 Markdown、JSON 和中间态(middle_json)等统一格式输出。

如果你更喜欢图形界面,用内置的 Gradio WebUI 即可:

mineru-gradio

启动后在浏览器访问 http://127.0.0.1:7860,上传文件并勾选解析选项就能出结果。

核心能力拆解

多格式文档如何解析

能做什么:原生解析 PDF、图片、DOCX、PPTX、XLSX,不需要先把 Word 转成 PDF 再处理,DOCX 走原生解析链路,端到端速度明显快于"先转 PDF"的传统做法。

怎么用:mineru -p <输入文件> -o <输出目录>即可,输入给目录时可以一次解析目录下所有受支持的文件。

表格与公式如何转换

能做什么:识别文档中的表格并转成 HTML,识别公式并转成 LaTeX,支持表格内图片/公式、跨页表格合并等复杂场景。

怎么用:表格和公式识别默认开启,直接出结果;如果只处理纯文本、想加快解析速度,可以通过命令行参数关闭这两项,参数说明见命令行工具文档。

OCR 与多语言内容如何处理

能做什么:自动检测扫描版 PDF 和乱码 PDF 并启用 OCR,OCR 支持 109 种语言的检测与识别,中英文混合文档开箱可用。

怎么用:解析方式默认是auto,由 MinerU 自行判断走文本提取还是 OCR;使用 pipeline 后端时还可以传语言提示参数辅助识别。

输出格式与可视化校验

能做什么:除 Markdown 外,还输出按阅读顺序排序的 JSON 和包含丰富信息的中间格式,图片、图注、表格、脚注都会被提取保留。内置 layout 可视化和 span 可视化,把识别出的区块画回原页面上,便于质检输出质量。

怎么用:解析完成后在输出目录打开对应结果文件即可;做质量核对时,先看 layout 可视化图,确认区块划分和阅读顺序是否符合预期。

上图是 layout 可视化示例:页面上的正文段落、章节标题、公式块都被框出标注,一眼能看出版面切分是否正确。

适合谁、与相邻工具的差异

文档处理工具大致分三类,可以对照自己的需求选择:

工具类型特点局限
纯文本提取工具快,直接抽文本层多栏版面易乱序,表格公式丢失,扫描件无能为力
OCR 服务解决扫描件无文本层问题产出多为无结构文本,版面重建要自己再做
MinerU先识别版面,再按阅读顺序输出,表格公式直接转换对 GPU 机型有更高配置要求(可选)

对开发者来说,两个最实用的入口是 CLI 和mineru-api(FastAPI 服务),后者提供异步任务接口,方便搭批量解析流水线;也提供 MCP Server 和 Dify、RAGFlow、FastGPT 等框架的原生集成,接入 AI 编程工具或知识库平台都比较直接。

硬件上按需选择:pipeline 后端兼容性好,纯 CPU 就能跑;hybrid / vlm 后端精度更高,适合显存 8GB 以上的 GPU 机型。

资源导航

  • 官方文档(中文):docs/zh/
  • 快速上手与使用指南:docs/zh/usage/quick_usage.md
  • 核心解析源码:mineru/backend/
  • 示例文件与演示脚本:demo/

【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/29 13:53:42

从DAC0832到波形生成:数模转换原理与嵌入式实践详解

1. 项目概述&#xff1a;从数字到模拟的桥梁搭建 最近在整理实验室的笔记&#xff0c;翻到了当年做“实验21&#xff1a;DA数模转换”的记录&#xff0c;感触颇深。这个实验可以说是电子工程、自动化乃至嵌入式开发领域的一个经典入门项目&#xff0c;但它的意义远不止于完成一…

作者头像 李华
网站建设 2026/8/29 13:53:04

软件缺陷预测数据集:Java源代码缺陷记录

摘要&#xff1a;软件缺陷预测数据集是一个面向软件质量分析、源代码理解与缺陷预测研究的结构化代码数据集&#xff0c;共包含 15,000 条 Java 源代码记录和 126 个特征字段。数据集概述软件缺陷预测数据集是一个面向软件质量分析、源代码理解与缺陷预测研究的结构化代码数据集…

作者头像 李华
网站建设 2026/8/29 13:51:23

c++爱好者必点:goto语句详解

goto语句又称无条件跳转语句&#xff0c;用于改变语句执行顺序。基本语法 goto语句的一般格式为&#xff1a;goto jingyuanyinzhe_henlihai;注意&#xff1a;这里的 jingyuanyinzhe_henlihai&#xff08;中文&#xff1a;静渊隐者&#xff09; 是可以换成其他任何符合c命名规范…

作者头像 李华
网站建设 2026/8/29 13:50:32

智能命令工具的评审边界

智能命令工具的评审边界给智能体接上命令行之后&#xff0c;评审重点就不能停留在“回答是否准确”。普通问答说错一句&#xff0c;影响通常局限在对话里&#xff1b;命令工具一旦选错路径或参数&#xff0c;可能改文件、启动进程&#xff0c;甚至把本地内容带到外部服务。评审…

作者头像 李华
网站建设 2026/8/29 13:48:11

烟火检测数据集质量评估与实战验证指南

简介&#xff1a;烟火检测是计算机视觉中面向真实安防场景的关键任务&#xff0c;核心在于明火与烟雾的像素级定位与区分。其技术难点源于火焰动态性、烟雾弥散性及二者共存易混淆等物理特性。高质量数据集需满足标注一致性、场景真实性与小目标覆盖三大工程要求。本文聚焦‘已…

作者头像 李华