论文

证据链:迭代检索增强生成的像素级视觉归因

Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

上下文与知识检索增强

摘要

迭代检索增强生成 (iRAG) 已成为通过逐步检索和推理外部文档来回答复杂多跳问题的强大范例。然而,当前的系统主要对解析的文本进行操作,这产生了两个关键瓶颈:(1)\textit{粗粒度归因},用户需要根据模糊的文本级引用在冗长的文档中手动查找证据; (2) \textit{视觉语义损失},将视觉丰富的文档(例如幻灯片、带有图表的 PDF)转换为文本会丢弃推理所必需的空间逻辑和布局线索。为了弥补这一差距,我们提出了 \textbf{证据链 (CoE)},这是一个与 检索器 无关的视觉归因框架,它利用视觉语言模型直接对检索到的候选文档的屏幕截图进行推理。 CoE 消除了特定于格式的解析并输出精确的边界框,从而可视化检索到的候选集中的完整推理链。我们在两个不同的基准上评估 CoE:\textbf{Wiki-CoE},一个源自 2WikiMultiHopQA 的大规模结构化网页数据集;以及 \textbf{SlideVQA},一个具有复杂图表和自由格式布局的具有挑战性的演示幻灯片数据集。实验表明,经过微调的 Qwen3-VL-8B-Instruct 实现了稳健的性能,在需要视觉布局理解的场景中显着优于基于文本的基线,同时为像素级可解释 iRAG 建立了与 检索器 无关的解决方案。我们的代码可在 https://github.com/PeiYangLiu/CoE.git 获取。