论文

无需坐标或区域标签的视觉文档证据归因

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

模型训练强化学习

摘要

可靠的视觉文档理解要求每个答案关联到支持它的证据区域。现有基准和系统常要求模型输出证据框坐标,但即使回答正确,视觉语言模型也常定位错误,形成归因幻觉。论文检验问题是否部分来自坐标表达接口。在经验证的双语 CiteVQA 子集上,比较直接坐标接口与语言接口:模型仅输出逐字引用的证据文本,多模态检索器再将每段引用定位到版面解析器提供的页面区域;表格与图形通过图注或注释引用。六种视觉语言模型中,证据召回分值从不超过 8 提高到 26–47,幻觉率约减半,答案质量变化较小。论文进一步以同一引用—检索流程作为训练机制:考虑到长文档区域证据标注昂贵,使用评判模型读取标准答案及检索区域裁剪图产生 GRPO 奖励,训练模型引用更好的证据,无需区域标签;8B 主干的严格归因准确率从 22.4 提至 33.8。该方法为无需坐标接口与昂贵区域监督的证据归因提供了路径。