来源:互联网 更新时间:2026-08-22 14:07
先说个关键信息:在7月4日的WAIC 2024科学前沿主论坛上,书生·浦语2.5正式发布,随之一起升级的还有面向大模型研发与应用的全链条工具体系。其中,上海人工智能实验室(上海AI实验室)大模型数据基座OpenDataLab团队开源了一款全新的智能数据提取工具——

这款工具厉害在哪儿?简单说,它能把那些混合了图片、公式、表格、脚注等复杂元素的PDF文档,精准地转成清晰易读的Markdown格式。不止于此,它还能从充满广告干扰或格式复杂的网页、电子书中,快速抽取核心内容。这样一来,AI语料的准备效率能大幅提升,尤其适合那些需要利用大模型、RAG技术,结合学术文献、财务报告、法律文件、电子书籍等专业文档,来打造垂直领域知识引擎的团队。
MinerU代码公开后,凭借精准快速的SOTA效果,性能甚至媲美甚至超越了一些商业软件,不仅收获国内外多个技术大V点赞,GitHub Star更是飙升至3000+,一度登顶GitHub Python Trending(2024年7月28日-29日)。可以说,它已经成为AI数据清洗领域一个相当亮眼的开源工具。
MinerU的核心能力是把PDF转化为Markdown格式,既支持本地文档,也支持存储在S3协议对象存储上的文件。来看看它具体能做些什么:
<iframe allowfullscreen="" frameborder="0" src="https://mp.weixin.qq.com/mp/readtemplate?t=pages/video_player_tmpl&action=mpvideo&auto=0&vid=wxv_3567579943246397447"></iframe>
(MinerU功能完整介绍视频)
相比网页、电子书这些结构相对标准化的文件,PDF文档包含的元素更复杂,处理起来挑战更大,也更具代表性。下面就以PDF为例,重点讲讲MinerU是如何实现高质量文档数据提取的。
(流程图)
MinerU支持不同类型的PDF文档提取,包括文本型、图层型、扫描版。一开始,系统会对输入的PDF进行文档分类,提取元数据,检测是否有乱码,是否是扫描版——这一步,相当于先给PDF文档做个“体检”,确定它的类型和状态。(注:文本型PDF文字可直接复制;图层型PDF文字不可直接复制,解析可能出现乱码。)
接下来,借助高质量的PDF模型解析工具链,系统会进行Layout区块布局检测,准确定位标题、正文、图片、表格、脚注、边注等重要元素的位置。同时,公式检测模型会锁定公式区域。最后,结合高质量的公式识别和OCR技术,提取出准确的文本和公式内容,统一存入JSON文件中。
模型处理完的数据会进入管线进行后处理,关键动作包括:确定块级别顺序、删减无用元素、按照版面进行内容排序和拼装,确保正文流畅。处理方式涵盖坐标修复、高iou处理、图片与表格描述合并、公式替换、图标转储、Layout排序、无用元素移除、复杂布局过滤等。经过这步,文档信息会被转化为一个统一的中间态——middle-json,它包含了PDF解析出来的所有信息。基于这个中间态,开发者可以根据需要自定义输出Layout、Span、Markdown、Content list等不同格式。(注:Content list是作者团队开发的一种列表结构格式,比Markdown保留的信息更丰富,适合用于多模态、NLP等大模型训练。)
团队利用由论文、教材、试卷、研报等多种文档组成的人工标注PDF自测评测集,对整个流程进行检测。这样一来,每次开发调优或算法改进后都能确保提取效果持续提升。同时,他们还配合可视化质检工具,对提取结果进行人工质检与标注,再反馈给模型训练,形成正向循环。
MinerU的PDF模型解析工具链 PDF-Extract-Kit,由四个关键模块组成:
在论文、教材、研报、财报等多样化的PDF文档上,MinerU的pipeline都能给出准确的提取结果,即使面对扫描模糊、水印等情况,也表现出较高的鲁棒性。
(不同类型PDF提取效果示意)
以下从几个核心维度来看MinerU的表现。
作者团队将MinerU与现有的开源Layout检测模型进行了对比,包括 DocXchain、Surya、360LayoutAnalysis 的两个模型。其中的 LayoutLMv3-SFT 是在 LayoutLMv3-base-chinese 预训练权重基础上进一步做了SFT训练的模型。论文验证集由402张论文页面构成,教材验证集由587张不同来源的教材页面构成。
作者团队将MinerU与开源的 Pix2Text-MFD 模型做了对比。其中的 YOLOv8-Trained 是在 YOLOv8l 模型基础上训练后的权重。论文验证集由255张论文页面构成,多源验证集由789张不同来源的页面构成,包括教材、书籍等。
这一块作者团队直接使用了 UniMERNet 的权重,没有进一步做SFT训练,其精度验证结果可在其GitHub页面获取。
使用了PaddleOCR官方提供的权重,没有做进一步的训练和验证。
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
腾讯ima怎么创建共享知识库?
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
WorkBuddy微信版怎么获得积分?
车载冰箱重置到出厂设置几步?
5000元起的鼠标哪个最值得入手?
比特币 2025 年价格预测:BTC 的未来走势
笔记本移动电源推荐哪款?
结婚家电首选:Leader懒人三筒Ultra热泵洗烘一体
短剧《史上最强洪荒修为》剧情介绍
kimi提示词专家使用方法新手指南
Aptos(APT)2026-2032年价格预测与历史走势梳理
短剧《仙人跳获透视,古玩玉器我全拿捏》剧情介绍
腾讯ima知识库怎么分类管理?
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc