论文

Spatial-OPSD:通过无标签自蒸馏自我改进空间推理

Spatial-OPSD: Self-Improving Spatial Reasoning via Label-Free Self-Distillation

摘要

视觉语言模型 (VLM) 越来越多地在具体化和基于空间的环境中运行,其中对深度、视点和三维关系的准确理解至关重要。然而,改进空间推理通常依赖于真实答案、答案衍生奖励或其他形式的特定于任务的监督。我们引入了 Spatial-OPSD,这是一种无标签的自我改进框架,它利用感知和重建工具自然提供的空间结构。在训练期间,有特权的教师会自动接收可获取的空间先验信息,例如深度、重建的 3D 关系和相机几何形状,而学生仅观察原始的视觉语言输入。在学生自己采样的轨迹上,教师提供密集的词元级监督,使学生能够在推理时内化空间知识,而无需真实答案标签或特权信息。为了将这种监督扩展到单轮之外,我们采用了逐轮递归训练方案:教师在每一轮中保持冻结以提供稳定的学习目标,改进后的学生在下一轮中初始化教师和学生,其中特权空间先验重新建立信息丰富的教师-学生不对称性。这样可以实现反复的自我改进,同时避免优化过程中教师快速移动。在四个 VLM 系列中,单轮 Spatial-OPSD 持续提高了五个基准的平均值,而三轮则进一步将强大的空间专用模型推向开源前沿,在开放模型中实现了最高的平均值,并在五个空间推理基准中的三个上取得了最佳结果。我们的代码可在 https://github.com/vermouth599/Spatial-OPSD. 获取