[](https://github.com/opendatalab/MinerU)
[](https://github.com/opendatalab/MinerU)
[](https://github.com/opendatalab/MinerU/issues)
[](https://github.com/opendatalab/MinerU/issues)
[](https://pypi.org/project/mineru/)
[](https://pypi.org/project/mineru/)
[](https://pepy.tech/project/mineru)
[](https://pepy.tech/project/mineru)
[](https://mineru.net/OpenSourceTools/Extractor?source=github)
[](https://huggingface.co/spaces/opendatalab/MinerU)
[](https://www.modelscope.cn/studios/OpenDataLab/MinerU)
[](https://colab.research.google.com/gist/myhloli/a3cb16570ab3cfeadf9d8f0ac91b4fca/mineru_demo.ipynb)
[](https://arxiv.org/abs/2409.18839)
[](https://arxiv.org/abs/2509.22186)
[](https://arxiv.org/abs/2604.04771)
[](https://deepwiki.com/opendatalab/MinerU)

[English](README.md) | [简体中文](README_zh-CN.md)
🚀立即访问 MinerU → ✅ 免安装网页版 ✅ 全功能桌面客户端 ✅ 即时 API 访问;无需部署烦恼,一键获取所有产品格式。开发者,快来体验吧!
👋 加入我们的 Discord 和 微信 社区
MinerU — 面向 LLM · RAG · Agent 工作流的高精度文档解析引擎
将 PDF · DOCX · PPTX · XLSX · 图片 · 网页转换为结构化 Markdown / JSON · VLM+OCR 双引擎 · 支持 109 种语言
MCP Server · 与 LangChain / Dify / FastGPT 原生集成 · 支持 10+ 国产 AI 芯片
**🔍 核心解析能力**
- 原生支持 `DOCX`、`PPTX` 和 `XLSX` 解析
- 公式 → LaTeX · 表格 → HTML,精准版面重构
- 支持扫描文档、手写体、多栏布局、跨页表格合并
- 输出遵循人类阅读顺序,自动去除页眉/页脚
- VLM + OCR 双引擎,支持 109 种语言 OCR 识别
**🔌 集成方案**
| 使用场景 | 解决方案 |
|----------|----------|
| AI 编程工具 | MCP Server — Cursor · Claude Desktop · Windsurf |
| RAG 框架 | LangChain · LlamaIndex · RAGFlow · RAG-Anything · Flowise · Dify · FastGPT |
| 开发集成 | Python / Go / TypeScript SDK · CLI · REST API · Docker |
| 零代码 | mineru.net 在线版 · Gradio WebUI · 桌面客户端 |
**🖥️ 部署方式(私有化 · 全离线)**
| 推理后端 | 适用场景 |
|------------------|---------|
| pipeline | 快速稳定,无幻觉,支持 CPU 或 GPU 运行 |
| vlm-engine | 高精度,支持 vLLM / LMDeploy / mlx 生态 |
| hybrid-engine | 高精度,原生文本提取,低幻觉 |
国产 AI 芯片:昇腾 · 寒武纪 · 燧原 · 沐曦 · 摩尔线程 · 昆仑芯 · 天数智芯 · 海光 · 壁仞 · 平头哥
更新日志
本次更新聚焦于 pipeline 后端的 OCR 能力升级、OCR 处理流程优化 和 模型下载体验改进。主要更新内容包括:
-
OCR 模型升级与处理加速
pipeline 后端的 OCR 模型升级至 PP-OCRv6,在 OmniDocBench v1.6 上 OCR 准确率提升约 11%。
- 移除了 OCR 语言选择中的日语、繁体中文、英语和拉丁语选项。这些场景现在统一路由到
ch OCR 模型,简化了模型配置和语言选择。
- 优化了 OCR 推理与处理流水线,OCR 处理速度提升约
100%,显著提高了批量文档和 OCR 密集型文档的解析效率。
-
模型下载逻辑优化
- 新增自动模型源选择功能,首次安装时会根据当前网络环境自动选择更优的模型源。
- 下载模型前,MinerU 会优先检查本地已下载的模型缓存文件。命中缓存可直接复用,减少重复下载和不必要的远程请求。
- 更多关于模型源配置、自动源选择及本地模型使用的详情,请参阅模型源文档。
随着 3.4 版本的发布,MinerU 进一步提升 pipeline 后端在 OCR 场景下的解析精度和处理效率,同时优化模型下载、缓存复用以及本地配置回写,使首次安装、模型更新和多环境部署更加稳定和自动化。
本次更新聚焦于 混合解析性能优化 和 VLM 模型能力升级。主要更新内容包括:
随着 3.3 版本的发布,MinerU 在保持高精度解析的同时,进一步提升了 Hybrid 后端在跨平台、多场景下的效率。默认的 medium 强度更适合大多数日常文档处理任务,而 high 则面向需要极致解析精度或 图像分析 能力的场景。
本次更新聚焦于 许可证开放、解析精度提升与全格式原生支持。主要更新内容包括:
- 许可证升级
- MinerU 正式从
AGPLv3 迁移至 MinerU 开源许可证,这是一个基于 Apache 2.0 的定制许可证。
- 这一变更显著降低了社区用户和商业部署的使用门槛,使 MinerU 更容易集成到真实业务工作流中。
- VLM 主模型升级
- 主 VLM 模型升级至
MinerU2.5-Pro-2604-1.2B,整体解析精度达到业界领先水平。
- 新模型支持图像和图表解析、截断段落合并、跨页表格合并以及表格内图像识别,进一步强化了对复杂文档版式的处理能力。
- 全格式原生解析支持
- 原生解析支持现已扩展至
PPTX 和 XLSX。
- MinerU 现已全面支持对图片、
PDF、DOCX、PPTX 和 XLSX 的解析,提供更完整的跨格式文档理解工作流。
随着 3.1.0 版本的发布,MinerU 变得更加开放、准确且更易于在生产环境中采用。新许可证降低了社区和商业使用的门槛,MinerU2.5-Pro-2604-1.2B 提升了复杂内容的解析质量,原生 PPTX / XLSX 支持则完成了对主流文档格式端到端的覆盖。
本次发布围绕 解析能力、系统架构与工程可用性 进行了系统性升级。主要更新内容包括:
- 原生
DOCX 解析
- 正式支持原生
DOCX 解析,可在无幻觉的情况下提供高精度结果。
- 相比传统先转换
DOCX 为 PDF 再解析的工作流,端到端速度提升数十倍,更适合对精度和吞吐量都有高要求的场景。
pipeline 后端升级
pipeline 后端在 OmniDocBench (v1.5) 上取得 86.2 分,超越上一代主流 VLM MinerU2.0-2505-0.9B 的精度水平。
- 新增对表格内图像/公式解析、印章文字识别、竖排文字支持以及行间公式编号识别的支持,持续提升复杂文档场景的解析质量。
- 在保持高精度的同时,资源占用极低,并继续支持纯 CPU 环境下的推理。
API / CLI / Router 编排升级
mineru 现在作为基于 mineru-api 的编排客户端运行;当未提供 --api-url 时,会自动启动本地临时服务。
mineru-api 新增异步任务端点 POST /tasks,支持任务提交、状态查询和结果获取;同时保留同步解析端点 POST /file_parse 以兼容旧插件。
- 新增
mineru-router,专为多服务、多 GPU 场景的统一入口部署和任务路由设计;其接口与 mineru-api 完全兼容,支持自动任务负载均衡。
- 部署与可用性改进
- 解决了与
torch >= 2.8 的兼容性问题;基础镜像升级至 vllm0.11.2 + torch2.9.0,统一了不同计算能力平台的安装路径。
- 采用滑窗机制优化了解析流水线,显著降低了长文档场景的峰值内存占用,数万页的文档不再需要手动拆分。
pipeline 的批处理推理现在支持流式写盘,能够及时写出已完成的解析结果,进一步优化长任务的体验。
- 完成线程安全优化,现已全面支持多线程并发推理;与
mineru-router 配合,可一键部署多 GPU,轻松构建高并发、高吞吐的解析系统。
- 完全移除了对两个 AGPLv3 模型(
doclayoutyolo 和 mfd_yolov8)以及一个 CC-BY-NC-SA 4.0 模型(layoutreader)的使用。
此次更新不仅仅是一系列功能增强,更是 MinerU 整体系统能力的一次关键飞跃。我们针对长文档解析的峰值内存占用问题进行了专项优化,通过滑窗和流式写盘等优化,使超长文档解析从“需要手动拆分、小心处理”变为“稳定、可扩展、能上生产”。同时我们完成了线程安全优化并全面启用多线程并发推理,进一步提升单机在高并发负载下的资源利用率和运行稳定性。在此基础上,借助 mineru-router 和新的 API / CLI 编排框架,MinerU 现已支持一键多 GPU 部署、跨服务统一接入和自动任务负载均衡,大幅降低了规模化部署的难度。由此,MinerU 正从一款单机数据生产工具,演进为面向高并发、高吞吐场景的大规模文档解析基础设施,为企业的文档数据处理提供更稳定、更高效、更易扩展的基座能力。
📝 查看完整的更新日志以获取更多历史版本信息
MinerU
项目简介
MinerU 是一款文档解析工具,可将 PDF、图片、DOCX、PPTX 和 XLSX 输入转换为 Markdown 和 JSON 等机器可读格式,供下游检索、抽取和处理使用。
MinerU 诞生于 InternLM 的预训练过程中。我们专注于解决科学文献中的符号转换问题,希望为大模型时代的技术发展做出贡献。
与知名商业产品相比,MinerU 仍然年轻。如果您遇到任何问题或结果不符合预期,请在 issue 中提交问题,并附上相关文档或示例文件。
https://github.com/user-attachments/assets/4bea02c9-6d54-4cd6-97ed-dff14340982c
核心特性
- 支持
PDF、图片、DOCX、PPTX 和 XLSX 输入。
- 移除页眉、页脚、脚注、页码等,确保语义连贯。
- 按人类阅读顺序输出文本,适用于单栏、多栏和复杂版面。
- 保留原始文档结构,包括标题、段落、列表等。
- 提取图像、图像描述、表格、表格标题和脚注。
- 自动识别并转换文档中的公式为 LaTeX 格式。
- 自动识别并转换文档中的表格为 HTML 格式。
- 自动检测扫描版 PDF 和乱码 PDF 并启用 OCR 功能。
- OCR 支持 109 种语言的检测与识别。
- 支持多种输出格式,如多模态和 NLP 的 Markdown、按阅读顺序排序的 JSON 以及丰富的中间格式。
- 支持多种可视化结果,包括版面可视化和 span 可视化,便于高效确认输出质量。
- 内置 CLI、FastAPI、Gradio WebUI,支持本地编排和多服务部署。
- 支持纯 CPU 环境运行,同时支持 GPU/MPS 加速。
- 兼容 Windows、Linux 和 Mac 平台。
快速开始
文档解析是一项艰巨而复杂的任务。在复杂版面、扫描页面和手写内容等场景中,解析结果可能不尽如人意。我们建议您先尝试线上 demo,评估 MinerU 的解析质量和适用性,然后根据实际需求选择合适的部署方式。
如果您有解析效果不理想的文档样例,欢迎在 issue 中分享。我们将持续改进解析能力。
如果您遇到任何安装问题,请首先查阅 常见问题解答。
在线体验
官方在线 Web 应用
官方在线版本与客户端功能一致,界面美观、功能丰富,需要登录后使用
- [![OpenDataLab](https://img.shields.io/badge/webapp_on_mineru.net-blue?logo=data:image/svg+xml;base64,PHN2ZyB3aWR0aD0iMTM0IiBoZWlnaHQ9IjEzNCIgeG1sbnM9Imh