论文
场景自探索,随景规划
Planning with the Views via Scene Self-Exploration
摘要
VLM 能否预测每个摄像机的移动如何改变视图,并提前计划许多此类移动?我们将这种能力称为视图规划,要求(1)了解单个操作如何转换视图,以及(2)在多轮计划中组合许多此类转换来识别目标视图。我们在我们提出的 ViewSuite 中探索了这两种能力,ViewSuite 是真实 ScanNet 场景上的 3D 点云环境。在 13 个前沿 VLM 中,出现了一个关键的规划差距:它们拥有基本的视图动作知识,但无法在多回合计划中组合它,并且随着视点距离的增加,差距不断扩大。为了弥补这一差距,我们提出了一个迭代框架,该框架将自我探索与视图图蒸馏交替进行。关键的见解是,所有探索轨迹,无论其结果如何,都会共同形成一个视图图,该视图图紧凑地捕获视点如何在场景中连接。将此图提炼为不同的监督任务可以重塑策略分布,并克服阻碍纯强化学习的稀疏奖励。这将 Qwen2.5-VL-7B 在交互式视图规划方面从 2.5% 提高到 47.8%,超过了 GPT-5.4 Pro (18.5%) 和 Gemini 3.1 Pro (21.4%)。自我探索成为 VLM 的一条有前途的道路,可以在 3D 空间中主动推理和规划。
