论文

视觉-语言-动作中视觉外操作的空间记忆

Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action

摘要

我们介绍 SOMA,这是一种用于视觉-语言-动作 (VLA) 模型中视觉外操作的空间记忆框架。大多数现有的 VLA 隐含地假设与任务相关的对象始终可见,当目标落在相机视野之外时,会导致脆弱且反应性的行为。 SOMA 通过为 VLA 配备持久空间记忆来解决这一限制,该记忆是通过可移动头部摄像头获取的多视图观察构建的,从而能够超越当前视觉平截头体进行推理。该框架由三个部分组成:空间记忆构建,通过扫描将角度观察聚合成统一的空间语义表示;动态内存细化,随着时间的推移保持全局一致性;上下文记忆检索,在操作过程中激活与指令相关的空间线索。我们在五个具有挑战性的现实世界视觉外操作任务上评估 SOMA,包括目标物体最初不可见的多步和双臂场景。实验结果表明,SOMA 不仅提高了任务成功率,而且还引发了性质不同的操纵行为,具有更快的目标定位、减少了视点搜索以及在部分可观测性下近乎一次性的抓取。 RoboCasa GR1 和 SimplerEnv 上的额外实验进一步验证了 SOMA 内存设计在传统完全可观察设置下的有效性。代码即将发布。