论文
往哪里看:基础模型能否通过主动探索达到目标观点?
Where to Look: Can Foundation Models Reach a Target Viewpoint Through Active Exploration?
摘要
人类可以通过主动的头部和身体运动来再现目标图像指定的视点,但基础模型中的空间智能在很大程度上是作为对预先收集的观察结果的被动理解来研究的。我们介绍了目标视点再现(TVR)——一项主动任务,代理在 3D 环境中调整其视点,直到其观察结果与给定的目标图像匹配——以及 TVRBench,一个涵盖场景规模和目标视图视觉丰富度的室内模拟基准。 TVR 还远未得到解决:在评估方面,最强的开源和闭源模型仅达到 7.8% 和 12.0% 的成功率。细粒度分析确定了两个一致的瓶颈:现成的模型难以应对多转视觉历史,当视点再现需要身体平移而不是原地旋转时,性能急剧下降,从而暴露出将空间差异映射到具体运动方面的差距。为了研究缩小这一差距,我们构建了一个统一的 TVR 后训练 框架,涵盖专家轨迹 SFT、理论监督 CoT-SFT、离线单圈 GRPO 和来自实时模拟器的 同策略 多圈 GRPO。 Visual-action SFT 提供了主要收益,将 9B 开源模型的成功率提高到 50.8%;多转 GRPO 提供有针对性的多房间细化,总体达到 51.4%,而 CoT 监督和单转 GRPO 会降低闭环性能。这些结果使 TVRBench 成为测量和训练在 3D 环境中主动感知和行动的基础模型的测试平台。我们的代码、数据和模型可在 https://github.com/aim-uofa/TVRBench 获取。