论文
更多检索到的证据是否有助于利用扩散语言模型进行视觉检索增强生成?
Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?
摘要
视觉检索增强生成(RAG)通常会扩展检索到的证据集以提高答案页面覆盖率,隐含地假设所有可用证据都应传递给生成器。我们表明,这种假设不适用于扩散语言模型(DLM):检索更多页面会增加答案页面的召回率,而无条件地将所有检索到的页面传递给生成器通常会降低答案的准确性,这主要是因为语义冲突。潜在源分析通过并行去噪中的源一致性损失来解释这种不匹配,其中位置建议可以将不兼容的视觉源组合成不受支持的答案。我们进一步发现这种干扰在第一步答案块分布中已经可见,使得在解码之前评估证据成为可能。为了保持检索覆盖率,同时限制有害的视觉暴露,我们提出了基于熵的候选过滤器(ECF),这是一种 无需训练 证据接纳框架。为了减少个体候选人中不相关的内容,ECF构建了多粒度的证据单元;为了识别有益的附加证据,它使用空白控制的块置信度和检索排名来确定是否以及哪个候选者应该进入最终上下文。在三个多模态 DLM 和五个视觉 QA 基准中,ECF 比最强的固定 top-$k$ 输入平均提高了 2.62 个百分点的答案准确性,并且使用 LLaDA2.0-Uni,比每个数据集的最佳竞争 无需训练 结果平均提高了 2.37 个百分点。这些结果表明,通过选择性证据接纳而不是无条件证据扩展,更广泛的检索有利于视觉 DLM-RAG。代码可在 https://github.com/wjkuser/ECF 上公开获取。