温馨提醒
如果文章内容或图片资源失效,请留言反馈,我们会及时处理,谢谢
本文最后更新于2024年10月29日,已超过 180天没有更新
MinerU 是一款由上海人工智能实验室 OpenDataLab 团队开发的开源高质量数据提取工具,专注于从复杂 PDF 文档、网页和电子书中高效提取内容。它能够将包含图片、公式和表格的多模态 PDF 转化为 Markdown 格式(如 markdown、json),且具备高精度解析工具链,支持多种输入模型,支持自动识别乱码、转换公式为 LaTex、保留文档结构,支持176种语言的准确识别,适用于学术、财务、法律等领域,兼容 Windows/Linux/Mac 平台。
功能
MinerU的作用主要体现在以下几个方面:
删除页眉、页脚、脚注、页码等元素,保持语义连贯
对多栏输出符合人类阅读顺序的文本
保留原文档的结构,包括标题、段落、列表等
提取图像、图片标题、表格、表格标题
自动识别文档中的公式并将公式转换成latex
自动识别文档中的表格并将表格转换成latex
乱码PDF自动检测并启用OCR
支持CPU和GPU环境
支持windows/linux/mac平台
github地址:https://github.com/opendatalab/MinerU/
在线网址:https://opendatalab.com/OpenSourceTools
声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系客服QQ3387285338进行处理。


评论0+