# 开源的一键提取PDF、网页、电子书的宝藏工具MinerU

*Published:* 2024-10-30
*Author:* 飞翔001

#### 温馨提醒

如果文章内容或图片资源失效，请留言反馈，我们会及时处理，谢谢

本文最后更新于2024年10月29日，已超过 180天没有更新



MinerU 是一款由上海人工智能实验室 OpenDataLab 团队开发的开源高质量数据提取工具，专注于从复杂 PDF 文档、网页和电子书中高效提取内容。它能够将包含图片、公式和表格的多模态 PDF 转化为 Markdown 格式(如 markdown、json)，且具备高精度解析工具链，支持多种输入模型，支持自动识别乱码、转换公式为 LaTex、保留文档结构，支持176种语言的准确识别，适用于学术、财务、法律等领域，兼容 Windows/Linux/Mac 平台。

**功能**

MinerU的作用主要体现在以下几个方面：

删除页眉、页脚、脚注、页码等元素，保持语义连贯

对多栏输出符合人类阅读顺序的文本

保留原文档的结构，包括标题、段落、列表等

提取图像、图片标题、表格、表格标题

自动识别文档中的公式并将公式转换成latex

自动识别文档中的表格并将表格转换成latex

乱码PDF自动检测并启用OCR

支持CPU和GPU环境

支持windows/linux/mac平台

github地址：https://github.com/opendatalab/MinerU/

在线网址：https://opendatalab.com/OpenSourceTools