论文
VIG-RL:学习搜索与插入经核实的图像证据
VIG-RL: Learning to Search and Insert for Verified Image Grounding
摘要
在知识密集型场景中,提供可靠的交错文本图像响应需要经验证的图像依据对齐 (VIG):精确集成检索到的真实视觉证据。现有的检索增强框架主要依赖于解耦的静态管道,本质上无法动态推理何时需要外部知识以及视觉资产应根据上下文插入到何处。为了弥补这一差距,我们提出了 VIG-RL,这是一种自主代理框架,它将搜索-选择-插入工作流程制定为主动决策过程。 VIG-RL 在动态 ReAct 式循环中运行,通过强化学习进行优化,并以综合奖励系统为指导,全面评估代理的逐步工具执行和最终的多模式对齐。广泛的评估表明,VIG-RL 建立了一种新的最先进技术,显着优于现有的静态基线。