论文
VISOR:通过迭代搜索和超视距推理进行代理视觉检索增强生成
VISOR: Agentic Visual Retrieval-Augmented Generation via Iterative Search and Over-horizon Reasoning
摘要
视觉检索增强生成 (VRAG) 使视觉语言模型能够对视觉丰富的文档进行检索和推理。为了解决需要多步推理的复杂查询,代理 VRAG 系统将推理与迭代检索交织在一起。然而,现有的代理 VRAG 面临两个关键瓶颈。 (1)视觉证据稀疏性:关键证据分散在各个页面上,并且孤立地进行处理,阻碍了跨页面推理;此外,细粒度的图像内证据通常需要精确的视觉动作,其滥用会降低检索质量; (2) 长期搜索漂移:检索页面中视觉标记的积累会稀释上下文并导致认知过载,导致代理偏离其搜索目标。为了应对这些挑战,我们提出了 VISOR(通过迭代搜索和超视距推理的视觉检索增强生成),这是一个统一的单代理框架。 VISOR 具有用于渐进式跨页面推理的结构化证据空间,以及用于管理视觉动作的视觉动作评估和校正机制。此外,我们引入了带有滑动窗口和意图注入的动态轨迹,以减轻搜索漂移。它们锚定证据空间,同时丢弃早期的原始交互,防止上下文被视觉标记淹没。我们使用基于组相对策略优化的强化学习(基于 GRPO 的 RL)管道来训练 VISOR,该管道具有专为动态上下文重建而定制的状态屏蔽和贡献分配。 ViDoSeek、SlideVQA 和 MMLongBench 上的大量实验表明,VISOR 实现了最先进的性能,同时为长视野视觉推理任务保持合理且可控的计算成本。源代码可在 https://github.com/syc1336/VISOR 获取。