论文
Spatial-Interactor:通过与可观测物理世界交互学习空间推理
Spatial-Interactor: Learning Spatial Reasoning through Interaction with the Observable Physical World
摘要
空间推理对视觉-语言模型(VLM)理解物理世界并在其中行动至关重要。在动态环境中推理要求 VLM 感知由物体运动和视角变化引起的局部状态转移,并在长轨迹上整合它们以维持最新的空间状态,而现有 VLM 在这两方面都能力有限。当前的空间训练主要关注关于物体属性和空间关系的静态问题,对状态转移提供的直接监督有限;相比之下,交互轨迹自然地把前一观测、一个动作和后续观测连接起来,为局部状态转移提供直接监督,而完整轨迹则揭示相邻转移之间的依赖。因此我们提出 Spatial-Interactor,一个训练 VLM 通过交互建模物理世界状态转移的框架,将学习过程组织为三级课程:L1 被动世界状态转移、L2 主动自我状态转移和 L3 长程交互轨迹。相应地,我们从模拟和真实交互轨迹构建了 Learning from Spatial Interaction 数据集(LSI-108K),任务与各级目标对齐。两阶段训练策略先用监督微调(SFT)训练 L1 和 L2 的局部转移建模,随后在线策略蒸馏(OPD)采用特权自蒸馏:获得片段级转移描述的教师分支监督学生的在线策略 CoT,帮助学生学会在 L3 长轨迹上整合连续转移。在多个 VLM 和空间基准上的实验显示,局部转移建模和长程整合均获得一致提升。
