论文

机器人操作视觉-语言-动作模型中的双重潜在记忆

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

摘要

主流视觉-语言-动作(VLA)模型主要根据马尔可夫假设下的当前观察来预测动作,因此难以应对长期的、时间相关的任务。现有的记忆增强 VLA 要么扩大观察窗口,要么从记忆库中检索历史作为辅助策略侧上下文。然而,它们将记忆留在了 VLA 推理的原生潜在嵌入空间之外,从而阻止了历史经验与多模态推理和行动形成的流畅交织。为此,我们引入了 LaMem-VLA,这是一种潜在记忆原生框架,它将历史经验重构为潜在记忆标记,并直接将它们与 VLA 推理交织在一起。 LaMem-VLA 的核心引入了四个协调组成部分:(i)一个策展人,将历史经验组织成两个互补的短期和长期记忆库; (ii) 搜寻者使用多模态认知查询两个金库以检索上下文相关证据; (iii) 将检索到的证据重建为紧凑的短期和长期潜在记忆标记的冷凝器; (iv) 编织器将这些内存标记与当前观察和指令一起注入到一个连续的嵌入序列中。通过完全在同一个连续潜在空间中表示、检索和消费历史经验,LaMem-VLA 使记忆能够直接参与 VLA 推理并在有界上下文下指导动作生成。在 SimplerEnv 和 LIBERO 上进行的大量实验证明了我们的 LaMem-VLA 的优越性。