论文
通过全局地图和局部视图进行多视图 3D 推理的密集奖励
Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
摘要
多视图 3D 视觉问答 (MV3D-VQA) 需要将部分观察结果集成到连贯的 3D 场景表示中,并为多步骤空间推理选择信息丰富的视点。然而,当前的多模态 LLM 通常是通过稀疏的答案级监督进行训练的,这通常会产生不一致的跨视图推理和脆弱的视图选择。我们提出了 DR-MV3D(MV3D-VQA 的密集奖励),这是一种基于地图的学习框架,可提供密集的、可验证的奖励来监督推理过程。我们的方法将 MV3D-VQA 分解为(i)异中心全局地图构建,(ii)问题条件视图轨迹规划,以及(iii)答案预测的以自身视角定位。为了使中间步骤无需手动注释即可学习,我们引入了两种奖励:将预测地图与来自冻结 3D 视觉基础模型(例如 VGGT + SAM3)的几何一致伪目标对齐的全局一致性奖励,以及监督有序视点选择的局部轨迹奖励。我们通过轨迹级策略优化(GRPO)来优化整个管道。 MindCube、VSI-Bench 和 BLINK (MV) 上的实验表明,DR-MV3D 在强大的多图像基线上持续改进,支持多视图 3D 推理的过程级密集监督的有效性。