论文
Dyn-3D:揭示并解决视觉语言模型中的自我运动模糊性
Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models
摘要
随着视觉语言模型 (VLM) 解决动态 3D 空间推理问题,自我运动感知对于解决单眼尺度模糊性至关重要。然而,当前的模型常常过度拟合平滑轨迹先验,而不是真正理解物理运动。因此,它们的空间推理能力在大位移下会严重退化,这种现象我们称之为运动崩溃。这种失败源于自然视频中虚假的视觉运动相关性和缺乏明确的身体监督。为了评估这一点,我们引入了 Dyn-3D,这是一个使用反事实 3D 渲染来严格分离视觉变化与真实运动学属性的基准测试。此外,我们提出了 TempoVista 框架,以 Kinematic-GSPO 算法为特色。通过将度量物理 真值 嵌入到策略优化中,TempoVista 明确地将视觉表示建立在 3D 空间中。实验表明,我们的方法通过利用相机动态作为有效的几何校准信号,显着改善了运动估计和鲁棒的空间推理。