论文
通过宽基线匹配在 MLLM 中引发复杂的空间推理
Eliciting Complex Spatial Reasoning in MLLMs through Wide-Baseline Matching
摘要
宽基线匹配 (WBM) 需要集成几何理解、视点变化、细粒度感知和遮挡推理,这使其成为物理环境中部署的多模态 大语言模型 (MLLM) 空间推理的具有挑战性的测试平台。然而,当前的 MLLM 缺乏针对这些能力的系统评估和训练框架。我们引入了 ReasonMatch-Bench,这是一个根据室内、室外和以对象为中心的场景中的视点位移和匹配粒度进行分层的基准,并表明当前的 MLLM 仍然难以处理细粒度的宽基线对应:在一个困难的 90 个样本子集上,人类注释者达到 84.0 F1,而现有的最佳基线达到 37.2。为了弥补这一差距,我们构建了一个可扩展的数据生成管道,可以自动从大规模视频 3D 语料库中提取宽基线视图对,包括 RGB-D 视频和 SfM 重建,从而产生多样化且可验证的监督。我们进一步提出动态对应强化学习(DCRL),它将图像级视点进展和点级对应课程相结合,通过可验证的奖励来改进 WBM 训练,而无需明确的 CoT 监督。大量实验表明,DCRL 极大地改进了 ReasonMatch-Bench 并转移到相关的空间基准,同时保持了一般视觉理解性能,并在多个基准上取得了适度的进步。