论文
PaDoc:文档解析中以版面为依据的并行解码
PaDoc: Layout-Grounded Parallel Decoding for Document Parsing
摘要
端到端文档解析器提供统一的接口,但将页面布局和区域内容序列化为一个自回归序列。这种表示法迫使独立的区域沿着一条长度随着总内容增长的解码路径,而基于裁剪的两阶段解析器在重复视觉预填充和碎片化的页上下文中暴露了区域级别的并行性。为了保留全页上下文而不依赖于依赖关系,我们提出了PaDoc,这是一种布局导向的解析器,将预测的布局视为共享页面表示上的分支结构。在区域充分性的假设下,我们推导出一个前缀条件因子化,在这种情况下,布局流和区域内容分支同时前进,从而减少解码深度到最长的布局-内容路径。我们在单个MLLM中实现这个因子化:紧凑的可变长度祖先注意力保留了标准下一个词元训练下的可见性,而掩藏并行解码创建了由评估的vLLM后端服务为并发请求的分支,共享前缀重用。在OmniDocBench Full上,PaDoc在整体布局F1上的综合分数达到91.1,与所有端到端解析器相比,在整体分数方面达到了顶级的94.24,并且在最佳文本编辑(0.038)和公式CDM(95.59)中表现最好。对于一个384页子集和一台A800 GPU,PaDoc是五种并发级别下最快的端到端解析器,提高了有效页面吞吐量67.4-118%并减少了相对基准线相同基础的顺序SFT基线的P95延迟39.2-54.9%。代码可在https://github.com/Longin-Yu/Padoc获取
