论文
MemoryVLA++:通过视觉-语言-动作模型中的记忆和想象力进行时间建模
MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models
摘要
时间建模对于机器人操作至关重要,因为有效的控制需要对过去交互的记忆和对未来状态的想象。然而,大多数 VLA 模型主要依赖于当前的观察,因此难以处理长期的、时间相关的任务。认知科学表明,人类依靠工作记忆来缓冲短暂的环境,依靠海马系统来保存过去经历的情景记忆,依靠内部模型来想象未来可能的状态演化。受这些机制的启发,我们提出了 MemoryVLA++,这是一个完整的时间建模框架,为 VLA 模型配备了用于机器人操作的记忆和想象力。预训练的 VLM 将当前观察结果编码为感知和认知标记,形成工作记忆。这些标记查询感知认知记忆库以检索相关的历史背景。该库存储过去交互中的底层细节和高级语义,并通过冗余感知整合进行更新。世界模型在去噪潜在空间中想象未来状态,并且想象的潜在空间在记忆指导下整合以形成完全时间感知的标记。生成的词元使扩散动作专家能够预测时间一致的动作序列。我们对 3 个机器人的 5 个模拟基准和 3 类真实机器人任务进行了广泛的实验,涵盖一般操作、长视野时间任务、鲁棒性和泛化。我们的方法在 Libero、SimplerEnv、Mikasa-Robo、Calvin、Libero-Plus 和各种真实机器人任务中实现了强大的性能,验证了利用记忆和想象力进行全时间建模的有效性。例如,在真实的机器人上,它在一般、依赖记忆和依赖想象力的任务上实现了 +9%、+26%、+28% 的增益。项目页面:https://shihao1895.github.io/MemoryVLA-PP-Web