论文

Zeva:可推广的具体操作的上下文因果学习

Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation

上下文与知识记忆Agent记忆

摘要

由于现实世界中不可见的物理条件,仅通过预训练仍然很难实现普遍的体现操作。我们认为,机器人需要在现实世界部署期间从自身的物理交互中动态学习,并利用这些知识来指导后续行动。我们提出了 Zeva,这是第一个能够从机器人自身的物理交互体验中进行上下文学习,同时保持策略模型冻结的框架。 Zeva 采用因果交互提取器将执行的动作及其引发的状态变化编码为因果交互信号,该信号存储在双时间尺度因果存储器中。对于后续行动,从内存中检索相关因果交互信号并将其作为上下文注入到冻结的策略模型中。模拟和现实操作实验表明,Zeva 在比较前沿 VLA 和 WAM 中实现了最佳性能,更重要的是,在部署过程中实现自我进化,无需梯度更新。随着机器人交互经验的积累,其成功率不断提高。此外,获得的交互体验可以跨任务推广。