论文
推理,然后再推理:跨视图重访改进空间推理
Reason, Then Re-reason: Cross-view Revisiting Improves Spatial Reasoning
摘要
以自我为中心的视频进行空间推理本质上是具有挑战性的,因为可观察到的证据受到摄像机轨迹的限制。现有方法依赖于单轮推理,迫使模型通过语义先验而不是可验证的证据来解决几何歧义。我们认为,空间推理应该是可重新审视的:在有限的证据下形成的结论应该在补充观点出现时仍然可以修改。基于这一见解,我们提出 Reason, then Re-reason (ReRe),这是一种 无需训练 推理时间框架,分为两个阶段:在 Reason 阶段,MLLM 根据原始视频形成空间假设;在 Reason 阶段,MLLM 根据原始视频形成空间假设;在重新推理阶段,它通过观察合成的小说视图视频来验证或修改假设。为了实现有效的跨视图重访,我们设计了一个几何到视频管道,可以从预测的 3D 几何中呈现战略性互补的新颖视图。这些视图具有跨场景覆盖的升高、倾斜视角,同时保留了 MLLM 的本机视频界面,无需进行架构修改。对 VSI-Bench 和 STI-Bench 的广泛评估表明,ReRe 极大地提升了开源 MLLM,使其能够与专有的最先进性能相媲美。项目页面:https://zhenjiemao.github.io/ReRe/