来源:互联网 更新时间:2026-08-19 14:23
文档解析领域的从业者都知道,阅读顺序预测是其中一块硬骨头。看似基础,但实际做起来,光是多栏排版、表格混排这些场景,就足以让传统规则束手无策。大多数OCR引擎只能按“从上到下、从左到右”的简单规则输出,遇到复杂文档基本就歇菜。深度学习模型虽能在特定领域表现亮眼,但数据标注成本极高——在本文出现之前,压根没有专门用于阅读顺序预测的大规模数据集。
EMNLP2021这篇论文,正是冲着这个痛点来的。它首次将深度学习引入阅读顺序预测,核心贡献有两个:一个叫ReadingBank的数据集,一个叫LayoutReader的模型。

数据集的构建思路非常巧妙。既然微软Word的DocX文件本身已经存了阅读顺序信息(XML格式里就有),那直接把它当成Ground Truth不就好了?于是他们从互联网上爬了21万个DocX格式的英文文档,保留每页超过50个单词的页面,最终随机选出50万页构成数据集——训练集40万页,验证集和测试集各5万页。每页都包含单词序列及其对应的边界框坐标,单词序列从DocX中提取,边界框则从由DocX生成的PDF中提取,中间用一套着色方案做匹配。这套自动化pipeline让大规模标注成了可能,也成为了后续工作的基石。

LayoutReader模型结构
模型本身是个序列到序列框架。编码器用的是LayoutLM——没错,就是那个能同时理解文本内容和布局位置的预训练模型。为了让信息流不被错误的顺序干扰,他们还设计了精细的自注意力掩码,在编码阶段就控制了哪些token之间可以“看到”。解码器则直接预测源序列中的索引,从而生成正确的阅读顺序。这种设计把文本和布局信息揉在一起,消融实验也证实了:两者缺一不可,结合后性能才真正起飞。
具体来说,LayoutReader有四个明显的优势:
站在今天看,LayoutReader的方案确实有些过时了。但它的核心贡献——那个自动化生成带阅读顺序的文档图像数据的pipeline——至今仍有借鉴价值。不过,缺点也很明显:
值得关注的是,有社区作者基于Transformers库中的LayoutLMv3对LayoutReader做了重实现,并做了不少改进:重构代码改用LayoutLMv3ForTokenClassification训练和评估,提供了将单词级别数据集转为文本片段级别数据集的脚本,实现了更好的后处理以避免重复预测,还发布了基于layoutlmv3-large微调的预训练模型(Hugging Face上可获取)。据其readme介绍,仅使用box框信息(未用文本)就能达到论文中相当的水平。
论文地址:https://arxiv.org/pdf/2108.11591
代码地址(原版):https://github.com/microsoft/unilm/tree/master/layoutreader
社区改进版:https://github.com/ppaanngggg/layoutreader
腾讯ima怎么把微信内容一键导入知识库?
黄金价格不断创新高!黄金稳定币XAU、PAXG市值达11亿美元
CC币价格预测(2026-2035):Canton币今日价格走势+长期价格预测
新浪互联网热点小时报丨2026年07月26日16时_今日实时互联网热点速递
2026鸣潮账号交易安全指南:五大交易平台对比与风险避坑分析
腾讯ima怎么创建共享知识库?
今日比特币暴涨分析:Metaplanet的比特币BTC投资推动股价上涨17%
新浪机器学习热点小时报丨2026年07月25日18时_今日实时机器学习热点速递
新浪人工智能热点小时报丨2026年07月30日18时_今日实时人工智能热点速递
蚂蚁庄园今日答案7月21日(今日已更新) 蚂蚁庄园今天正确答案是什么呢
比特币(BTC)核心周期指标复刻历史走势 价格或跌破5.8万美元关键支撑位
Celestia价格预测2026-2032:TIA币能否引领山寨币上涨行情?历史价格回顾
2026年三角洲行动账号交易指南:5大交易平台对比与安全选购建议
车载冰箱重置到出厂设置几步?
抖音怎么取消申请退货退款?抖音上取消退货怎么操作
腾讯ima知识库怎么分类管理?
短剧《史上最强洪荒修为》剧情介绍
WorkBuddy微信版怎么获得积分?
Windy卫星云图怎么看?云层变化识别技巧
TRUMP价格走势与WEPE预售进展解析
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc