来源:互联网 更新时间:2026-07-23 14:05
传统文档解析的效率瓶颈,说白了就是“串行等待”——明明正文、公式、表格之间互不依赖,却非得按顺序一个字一个字地生成。这种流水线式的模式,显然不是最优解。更高效的方式,其实就像团队协作:先整体规划布局,再让不同成员并行处理各自的任务,最后汇总结果。
基于这个思路,PaddleOCR 团队提出了

结果很直观:HPD-Parsing 将1B参数的基线模型 Token 吞吐量拉升到3倍以上。在单卡 NVIDIA A800 GPU 上,OmniDocBench v1.6 评测集的 TPS(每秒 Token 生成量)达到 4,752.1,页吞吐(PPS)为 2.68,解析精度依然保持行业第一梯队,而效率则遥遥领先。
代码和权重已经开源在 GitHub 和 HuggingFace,可以直接下载使用。
GitHub:https://github.com/PaddlePaddle/PaddleOCR
HuggingFace:https://huggingface.co/PaddlePaddle/HPD-Parsing
ArXiv 论文地址:https://arxiv.org/abs/2607.18839
这并非固定比例提升,而是从解码机制上缓解了“文档越长、等待越久”的结构性瓶颈。页面越复杂,可并行解析的区域越多,效率优势越明显。
对一个经典 1B 参数规模的统一式自回归模型,统计视觉编码器和语言解码器的耗时发现:视觉编码时间相对稳定,而解码耗时随输出长度快速增长。尤其在长文档场景中,解码时间可接近视觉编码时间的 500 倍。
这意味着,模型主要不是慢在“看完整张图片”,而是慢在“逐 token 写出结果”。更直观地说:文档模型已经可以快速看完整页,但仍然被迫一个字一个字地“抄写”。
仔细想想:页面结构确实需要全局理解——比如标题层级、多栏布局、区域位置和阅读顺序。但某个文本段落、公式或表格的具体内容解析,往往只依赖对应区域图像和必要的上下文,并不需要等待其他区域全部生成完毕。
HPD-Parsing 将传统单一解码序列重构为层级并行的生成过程。主布局分支负责识别页面中的区域类别、位置与阅读顺序;当一个区域的边界和类型确定后,模型便动态创建相应的内容分支,并行生成该区域的正文、公式或表格内容。
不同于传统 Pipeline 通过多个独立模块分阶段完成版面分析与内容解析,HPD-Parsing 将区域级并行直接融入统一模型的解码过程。各内容分支共享整页视觉上下文,主布局分支持续维护区域关系与阅读顺序,并依据全局布局结构组织最终输出。模型无需割裂页面上下文,即可将不同区域的内容生成转化为并发执行。
换句话说,HPD-Parsing 并非先将页面拆分为彼此独立的局部任务,而是在全局统一协调下并行生成不同区域的内容。
基于布局理解的动态分支解码,使不同文档区域可以并行生成,但每个分支内部仍保留逐 token 解码带来的串行路径。为进一步减少主布局分支和各个内容分支的解码步数,HPD-Parsing 进一步集成了 PaddleOCR 团队在 ECCV 2026 中提出的
P-MTP 能够在一次解码迭代中预测并验证多个后续 token,并将验证通过的 token 直接纳入输出。HPD-Parsing 平均每个解码步骤可接收
P-MTP 的模型结构、渐进式训练方式与推理验证机制,可参见此前的专题介绍。
由此,HPD-Parsing 形成了两个相互补充的并行维度:
前者减少区域之间的相互等待,后者减少单个区域内部的解码步数。二者协同作用,使整页内容不再沿着一条冗长的序列逐步生成,而是能够在不同区域之间并行展开,并在每个区域内部更快向前推进,从区域间和区域内两个层面共同缩短整体解析过程。
HPD-Parsing 构建了一套标准化的数据生产引擎。该引擎首先对原始文档进行特征提取、聚类与代表性采样,以扩大数据覆盖范围并减少重复样本;随后结合 PaddleOCR-VL-1.5、MinerU-2.5 Pro 等模型生成伪标签,并依据中间阶段模型与伪标签之间的解析差异,将样本划分为简单、中等和困难三个等级。对于困难样本,引入更强的视觉语言模型进行多轮检查、生成与纠正;最后从难度等级、文档类型以及文本、表格、公式和复杂版式等属性维度进行分布平衡,形成兼具多样性、可靠性和针对性的训练数据。
基于这一数据引擎,进一步构建了三阶段训练数据,用于支撑分阶段的 HPD 机制适配,使模型从传统全页生成逐步过渡到层级并行解码:
HPD-Parsing 通过三阶段训练逐步完成能力初始化、解码范式迁移与难例强化,并配合自动化难度感知数据构建,持续发现和补强模型的薄弱环节。布局与内容监督的分解,使不同解析能力可以得到更有针对性的优化,而统一模型框架仍保留了对整页上下文和页面结构的整体建模能力。
HPD-Parsing 将文档解析机制从“一条序列从头写到尾”,转变为“全局协调、局部并行”的模式,在有限的适配数据下,做到了精度可靠的同时摆脱了完整页面串行生成的约束。值得说明的是,这种解析机制的革新,与视觉 Token 压缩、注意力交互长度压缩等加速手段并不冲突,而是可以相互协同,实现更强的推理效率。
当然,它的意义不只在于一个更高的 TPS 数字,更在于提供了一种新的解码方式:页面结构需要全局协调,区域内容则可以局部并行。未来,这种结构化并行的思路有望进一步扩展到其他具有明确层级结构的生成任务中。
A: HPD-Parsing 是 PaddleOCR 团队面向文档解析推理加速提出的最新技术研究成果,建议应用场景聚焦在扫描文档场景且对于推理效率存在强需求的用户可以部署体验。对于解析效果存在强需求的用户,我们仍然建议使用 PaddleOCR-VL 系列作为第一选择。
七麦数据官网网页地址 七麦数据官方入口在线首页
问卷星官方网站入口地址 问卷星网页版在线使用
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
币安Binance官方中文网站 币安App最新版下载及新手注册指南
闲鱼的严选验货在哪里看?闲鱼严选和验货宝哪个可靠
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
豆包AI专业版使用教程【新手必看】
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
币圈十大实用工具:从实时行情监控到数据分析、资产管理
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
芝麻开门Gate.io官方网址入口 芝麻开门交易所新手账户注册流程
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
闲鱼严选和验货宝哪个可靠?闲鱼的验货宝怎么样,,
精准天气预报APP推荐:支持分钟级降雨预测与实时分享功能
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
网名开头英文名字男生(精选100个)
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc