论文

PreSIST:开放世界场景中基于视觉语言的对象持久性预测

PreSIST: Vision-Language-Informed Object Persistence Prediction in Open-World Scenes

应用与实践视觉感知与空间理解

摘要

长期部署的机器人必须对随时间变化的环境进行推理。现有的长期感知系统通常会被动地处理对象变化,仅在重新访问场景并观察到对象已移动后才更新其地图。相反,机器人应该利用物体出现的环境,主动推断物体可能会持续多久。例如,红绿灯处的汽车和停车位处的汽车共享相同的语义类,但它们的上下文意味着不同的持续时间。我们提出了 PreSIST(预测场景条件实例随时间生存),一种用于预测观察到的对象是否会在任意未来时间保持其最后看到的姿势的方法。 PreSIST 根据对象属性和场景上下文估计实例级持久性先验,然后在观察可用时将这些先验与概率持久性过滤器集成。其关键见解是视觉语言模型(VLM)的推理能力可以将场景上下文与可能的对象使用和人类活动联系起来,从而在获得长期观察之前实现持久性预测。我们开发了两种可互换的变体:PreSIST-Lang(使用 VLM 估计持久性先验)和 PreSIST-Vis(一种使用 PreSIST-Lang 伪标签训练的新颖的仅视觉模型,以实现高效部署)。对野外对象持久性注释的新数据集进行的实验表明,PreSIST-Lang 和 PreSIST-Vis 在开放世界持久性预测方面优于基线。