论文

导航稀疏证据:通过显式选择与整合实现智能体视觉RAG

Navigating Sparse Evidence: Agentic Visual RAG via Explicit Context Selection and Consolidation

上下文与知识模型训练强化学习上下文工程记忆Agentic RLAgent记忆

摘要

视觉检索增强生成 (VRAG) 通过检索相关页面图像作为视觉证据并对其内容进行推理,使模型能够导航和回答有关视觉丰富文档的查询。然而,有效利用这种视觉证据通常会受到两个主要挑战的阻碍。首先,与答案相关的证据很少,可能集中在一页的小区域中,也可能分散在多个页面中。其次,现有的代理方法通常基于原始探索轨迹或压缩文本记忆而不是明确组织的一组支持图像来生成答案,这使得答案容易受到探索噪音的影响,并模糊了有证据支持的推理轨迹。我们认为,瓶颈不仅在于证据发现,还在于答案生成之前的保存和组织。我们提出了 SCoRE(稳健证据的选择和合并),这是一个用于明确证据选择和合并的统一代理循环。在探索过程中,SCoRE 仅在维护的文本分类账中保留与查询相关的观察结果及其源指针,保留早期证据,同时保持视觉上下文的界限。终止时,它重新加载引用的原始图像并合并用于回答的视觉证据,将其排列成逻辑序列。这将最终推理与探索性试错脱钩,同时通过索引的声明到图像链接确保严格的视觉基础。为了实现这种统一部署的端到端优化,我们的训练范例将过滤冷启动轨迹蒸馏与证据感知强化学习相结合,其奖励可促进证据覆盖、巩固紧凑性和答案正确性。

导航稀疏证据:通过显式选择与整合实现智能体视觉RAG:论文配图
图1:视觉RAG利用视觉证据的两类挑战:(a)证据分布不均;(b)证据组织方式隐含。