论文

定位多页视觉丰富文档理解中的失败:一项实证归因

Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution

模型评测模型行为与机制分析

摘要

多页视觉丰富文档理解(MP-VRDU)需要管理稀疏、分布在多页之间且常常超出模型上下文窗口的证据。先前工作对这类系统应如何构建提出了相互竞争且大多未经检验的主张。我们将错误回答归因于三种失败模式——表示、选择与推理,并通过固定其余因素、只干预单一因素的方式,在多页文档理解数据集上逐一隔离它们。我们发现视觉是必要的,但不能替代文本抽取;缺失页限定了准确率上限,而干扰项的代价很小;推理器即使在被完整供给证据的情况下也无法跨页整合证据。提示词可以大幅改变推理行为,以牺牲某些结果为代价改善另一些结果。我们将这些发现转化为在固定计算预算下构建此类系统的指导。

定位多页视觉丰富文档理解中的失败:一项实证归因:论文配图
图1:三种失效模式及其机制。