论文

内联内存满足可重用技能:以内存为中心的视觉-语言-动作模型框架

Inline Memory Meets Reusable Skills: Memory-centric Framework for Vision-Language-Action Model

上下文与知识记忆Agent记忆

摘要

视觉-语言-动作(VLA)模型在通用机器人操作方面显示出了强大的前景,但使其适应新的任务和领域仍然效率低下:现有方法通常依赖于参数调整,从而产生大量成本,并面临灾难性遗忘先前学习任务的风险。为了解决这个问题,我们提出了 Optimus-R,一个以内存为中心的 VLA 框架,它将机器人适应制定为显式查询技能内存调整。 Optimus-R 引入了: (i) 一个 用于技能提取的内联内存接口。它将可学习的记忆标记插入到 VLA 前缀流中,允许主干在本机动作调节路径中导出控制感知查询和技能表示。 (ii) 用于技能学习的查询技能记忆库。它将技能具体化为查询原型,用于决定要检索的内容和用于指定如何操作的技能值,支持技能重用和通过有限的参数更新进行扩展。 (iii) 一个轻量级的用于技能更新的桥接和适应机制。它通过轻量级适配器和剩余内存更新将目标域查询和技能与现有内存空间保持一致。领域内适应、跨领域适应和终身学习的实验表明,Optimus-R 能够实现数据高效的技能学习,同时减少灾难性遗忘。