论文
HPD-Parsing:分层并行文档解析
HPD-Parsing: Hierarchical Parallel Document Parsing
摘要
高效的团队合作通常将全局协调与并行执行相结合,这一原则尚未在基于统一视觉语言模型 (VLM) 的文档解析器中得到充分体现。现有的统一解析器联合处理整个页面,但通过单个标记到标记的自回归轨迹生成其输出,从而创建了随着文档长度而增长的顺序瓶颈。这种全页顺序生成忽略了文档解析的一个关键属性:布局必须进行全局分析,而块内容可以并行解析。基于这一观察,我们引入了 HPD 解析,它用分层并行解码范例取代了整页自回归生成。主布局分支组织整个文档结构,并将块级内容解码动态分配给并发分支,而渐进式多词元预测 (P-MTP) 进一步减少每个分支内的解码步骤。公共基准测试表明,HPD-Parsing 每秒可处理 4,752 个词元,提供最快现有文档解析模型吞吐量的 2.62倍和普通自回归基线的 3.06倍吞吐量,同时保持具有竞争力的解析精度。这些结果确立了分层并行解码作为全页自回归生成的有效替代方案,为高效的统一文档解析开辟了新方向。