论文
ROVER:路由以对象为中心的视觉证据,用于扎根的多图像推理
ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning
摘要
多模态 大语言模型 (MLLM) 具有越来越多的本地化和交错的视觉证据,用于深思熟虑的推理。基于目标定位的方法通常通过将裁剪后的图像块或特定于 RoI 的特征注入推理上下文来关注感兴趣区域 (RoI)。然而,这样的设计可能会削弱整体场景理解和对象间关系,同时产生随着 RoI 的数量和大小而增加的解码成本。另外,自适应视觉特征选择通常需要细粒度的监督或复杂的启发式方法。为了解决这些限制,我们提出了 ROVER(用于基础多图像推理的路由以对象为中心的视觉证据),这是一个轻量级、可学习的插件,用于高效的全局视觉证据路由。在每个对象目标定位预测中,ROVER 都会注入一个特定于步骤的词元三元组,以协同地:(i)聚合正在进行的推理上下文,(ii)通过以对象为中心的差异注意将图像内线索提炼到视觉工作空间中,以及(iii)在该空间内跨对象和图像路由和集成历史感知证据以进行后续推理。我们将 ROVER 集成到 Qwen2.5-VL-7B 中,并开发了一个交错的 SFT-to-GRPO 训练管道。严格遵循原始数据集和评估协议,我们的方法在 MM-GCoT(+4.8% 答案准确率,+14.6% 目标定位准确率)和 VideoEspresso(+8.6% 答案准确率)上实现了最佳性能。经过 VideoEspresso 训练的模型表现出强大的可移植性,在各种基准测试中平均比基本模型高出 4.7%。