论文

PROSE:无需训练 使用视觉语言模型进行以自我为中心的场景注册

PROSE: Training-Free Egocentric Scene Registration with Vision-Language Models

应用与实践视觉感知与空间理解

摘要

注册在不同时间拍摄的同一室内空间的两次捕捉可以支撑机器人和 AR 系统的持久空间记忆,但该任务的现实版本是自我中心的,其最具可扩展性的形式是仅 RGB 的。头戴式摄像头会产生模糊、快速移动、部分重叠的视图,很难从中恢复密集的几何形状。经典配准完全依赖于这种设置所缺乏的干净点云,而学习的场景图方法需要预先构建或注释的图以及训练有素的匹配器,我们发现这些匹配器在以自我为中心的数据下很脆弱。我们采取了不同的路线,使用预训练的视觉语言模型作为场景理解和交叉扫描匹配的来源。我们的方法 PROSE(提示场景重新注册)使用现成的几何、分割和语言基础模型将每个 RGB 序列提升为对象级 3D 场景图,然后提示相同的 VLM 匹配两个 RGB 序列中的对象实例。为了使这种匹配易于处理且可靠,我们利用对象高度作为先验,并使用配对的相同/不同查询验证每个建议的匹配,然后通过假设每个匹配对象的候选对象并选择具有最强几何一致性的对象来解决刚性变换。 PROSE 不添加学习参数,也不需要深度传感器、训练或注释图。在以自我为中心的 Aria Digital Twin 和 Aria Everyday Activity 基准测试中,它在配准精度方面优于几何基线和学习场景图基线,在 真值 和 RGB 重建点云上都是如此,并且它生成的场景图直接传输到下游任务。