论文

Mem-World:用于持久机器人操作的记忆增强动作条件世界模型

Mem-World: Memory-Augmented Action-Conditioned World Models for Persistent Robot Manipulation

摘要

动作条件世界模型已成为机器人学习的一种有前途的范例,通过生成动作一致的视频展示,为昂贵的现实世界实验提供了可扩展的替代方案。然而,持久世界建模在操作方面仍然具有挑战性:频繁的末端执行器遮挡和快速的手腕相机运动使得当前的观察不足以预测未来的视图,导致模型忘记或产生在早期帧中看到的场景细节。现有的记忆检索策略通常无法识别动态操作场景中的信息历史。为了解决这个限制,我们提出了 Mem-World,一种记忆增强的多视图动作条件世界模型。其核心是,我们提出了 W-VMem,一种以 4D 手腕视图为中心的面元索引存储器,它将历史观察结果锚定到随时间变化的表面元素。通过显式建模观察场景元素的时间和地点,W-VMem 能够以几何感知方式检索以未来动作为条件的相关历史帧。在生成过程中,通过基于面元的渲染和评分选择相关历史帧,为预测提供信息丰富且非冗余的上下文。大量实验表明,Mem-World 在复杂的操作场景中生成持续连贯的生成轨迹,实现比 Ctrl-World 更可靠的策略评估,将 Pearson 与现实世界性能的相关性提高 14.5%,并通过合成数据生成支持有效的策略改进,将长期任务的成功率从 58% 提高到 72%。