论文

场景自探索,随景规划

Planning with the Views via Scene Self-Exploration

智能体系统Agent 规划

摘要

VLM 能否预测每个摄像机的移动如何改变视图,并提前计划许多此类移动?我们将这种能力称为视图规划,要求(1)了解单个操作如何转换视图,以及(2)在多轮计划中组合许多此类转换来识别目标视图。我们在我们提出的 ViewSuite 中探索了这两种能力,ViewSuite 是真实 ScanNet 场景上的 3D 点云环境。在 13 个前沿 VLM 中,出现了一个关键的规划差距:它们拥有基本的视图动作知识,但无法在多回合计划中组合它,并且随着视点距离的增加,差距不断扩大。为了弥补这一差距,我们提出了一个迭代框架,该框架将自我探索与视图图蒸馏交替进行。关键的见解是,所有探索轨迹,无论其结果如何,都会共同形成一个视图图,该视图图紧凑地捕获视点如何在场景中连接。将此图提炼为不同的监督任务可以重塑策略分布,并克服阻碍纯强化学习的稀疏奖励。这将 Qwen2.5-VL-7B 在交互式视图规划方面从 2.5% 提高到 47.8%,超过了 GPT-5.4 Pro (18.5%) 和 Gemini 3.1 Pro (21.4%)。自我探索成为 VLM 的一条有前途的道路,可以在 3D 空间中主动推理和规划。

场景自探索,随景规划
图 1:ViewSuite 概述。左:基于 ScanNet 构建的点云环境,具有视点(初始为蓝色,目标为橙色)和渲染的第一人称视图。中:路径到视图(P2V;根据动作序列预测结果视图)和视图到路径(V2P;从两个视图推断动作序列),均为单轮。右图:交互式视图规划 (IVP),这是一项多回合任务,其中代理计划视图更改以匹配目标视图并提交视点估计。