论文

TAEC:多步视觉 RAG 的轨迹感知证据协调

TAEC: Trajectory-Aware Evidence Coordination for Multi-Step Visual RAG

上下文与知识检索增强

摘要

多步骤视觉检索增强生成(RAG)通过重复检索视觉证据、更新中间状态并决定是否继续搜索或回答来回答复杂问题。然而,检索相关证据并不能确保其在整个推理轨迹中得到有效使用。随着多步推理的进展,冗余源占据了缺失证据所需的上下文容量,与已解决的需求或无效搜索相关的观察结果在上下文中徘徊,并且重新审视视觉源,但细节不足,无法进行细粒度的阅读。我们将推理轨迹上可用证据的丢失称为轨迹级证据利用率下降。为了解决这个问题,我们提出了轨迹感知证据协调(TAEC),这是一个无需训练的框架,可以围绕未解决的答案要求协调证据的使用。 TAEC 在共享轨迹状态下跟踪这些要求,以指导哪些证据进入上下文、如何保留积累的记忆以及在何种详细程度检查视觉证据。在 ViDoSeek、SlideVQA 和 MMLongBench-Doc 上的统一评估协议下,TAEC 相对于领先的免训练视觉 RAG 基线实现了最佳整体性能,并且在多个专有视觉语言模型中具有最高的平均准确度。这些结果表明,将证据与不断发展的推理需求相结合可以改善整个多步骤视觉 RAG 中的证据使用。