论文

展开世界:分解 4D 属性以强化空间推理

Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning

模型训练强化学习

摘要

尽管视觉语言模型(VLM)在一般多模态任务中具有非凡的能力,但它们在推理物理世界时基本上仍然是“平坦的”。我们认为,这种空间瓶颈源于严重的维度不匹配:虽然 VLM 被训练来解释 2D 投影,但真正的空间推理需要恢复潜在的 3D 几何和时间连续性。为了克服这种高维复杂性,我们主张从整体学习转向“分而治之”范式。我们提出了 FactoSR,一种因式分解的强化学习框架,可以明确地解释视觉投影所折叠的维度。 FactoSR 的核心是将世界一致推理的整体问题分解为三个正交的几何子目标:平面对应性 ($XY$)、深度一致性 ($Z$) 和时间可逆性 ($T$)。通过在统一的策略学习机制中优化这些可验证的约束,我们有效地将不适定的投影恢复问题转化为一系列切实的推理步骤。对多视图和视频基准的广泛评估表明,这种优雅的分解在 3D 和 4D 推理方面产生了巨大的收益,在 VSI-Bench 上实现了 5.9% 的提升,在 All-Angles-Bench 上实现了 4.5% 的提升。我们的研究结果表明,加强显式的、因式分解的 4D 一致性是将 VLM 发展为强大的、世界感知的推理器的关键一步。