论文

用于鲁棒分布外视觉文档理解的结构化布局先验

Structured Layout Priors for Robust Out-of-Distribution Visual Document Understanding

上下文与知识上下文工程

摘要

视觉语言模型 (VLM) 端到端地解析文档,但与训练中看到的布局不同,布局经常出现故障。我们将此归因于两跳瓶颈:在解码器可以提取内容(跳 2)之前,它必须首先对封闭的布局实体(跳 1)进行分类和本地化,并且当第一跳失败时,第二跳会崩溃为遗漏、畸形结构或自回归重复。我们通过运行轻量级 RT-DETR 检测器,在解析器的本机 DocTags 词汇表中序列化其输出,并将它们与整页图像一起注入到提示中,从而在解码器外部预解析第 1 跳。与裁剪页面的分析然后解析方法或以纯文本编写的先前提示级先验不同,我们的先验共享解码器的生成空间,并在检测有噪声时将全局图像作为后备。在 10,000 页结构性发行外基准上,降价 F1 从 0.37 美元升至 0.92 美元;在 OmniDocBench 的中文子集上,表 TEDS 从 $0.01$ 上升到 $0.36$;在 26k 页 ViDoRe V3 基准测试中,每个测试的工业领域的无限循环解码失败率均有所下降。这些收益花费了 15\%$ 的挂钟延迟和中位数为 74$ 的提示词元,并且没有对基础 VLM 进行架构更改。注意力级别分析进一步揭示了双峰相移,其中解码器在发出结构时关注注入的布局标记,在发出内容时关注图像补丁,这与缓解的两跳瓶颈一致。将发布模型权重以支持可重复性。