论文

MemoryVAM:将内存集成到机器人操作的视频动作模型中

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

摘要

视频世界模型策略通过预测未来的观察来学习与动作相关的表示。然而,它们仅以较短的观察窗口为条件,当正确的行动取决于不再可见的早期事件时,这会导致长视野操纵非马尔可夫。我们提出了 MemoryVAM,一种用于视频世界模型策略的情景记忆机制。我们采用 Recap-Cue (RC) 模块,其中基于感知器的 Recap 压缩器将每帧 CLIP 嵌入映射到紧凑的内存标记中,而轻量级的 Cue Gate 根据内存和语言估计任务完成情况。这些词元被注入视频主干和动作解码器中,使政策想象力与情节进展和历史条件动作保持一致。我们的模型通过视频预测、增量重建辅助损失和情节边界监督来训练内存模块,不需要每帧进度标签。通过仅更改交叉注意力注入接口,相同的机制适用于 UNet 和 Diffusion Transformer (DiT) 主干。在 LIBERO-Mem 上,我们的模型将平均成功率从 5% 提高到 42.5%。在真实的机器人上,它在计数任务上取得了 78.3% 的成功率,在空间回忆上取得了 80.0% 的成功率,在顺序跟踪上取得了 75.0% 的成功率。项目页面:https://MemoryVAM.github.io/