论文
Divide-and-Remember:长程 VLA 策略的递归操作相关内存
Divide-and-Remember: Recursive Action-Relevant Memory for Long-Horizon VLA Policies
摘要
视觉-语言-动作(VLA)模型在依赖于历史的操纵任务中挣扎,其中当前的观察本身并不能决定动作,并且策略需要历史的记忆。现有的记忆方法通过设计决定要记住什么,例如,保留像素变化较大的帧,并在任务之间显示不一致的增益。我们将要记住的内容视为优化问题。从模仿学习的 POMDP 公式中,我们表明,在给定当前观察的情况下,最优记忆最大化了动作和记忆之间的条件互信息 $I(a_t; m_t \mid o_t)$。直观上,这意味着保留历史中尚未包含在当前观察中的与操作相关的信息。根据我们的分析,我们提出了分割记忆(D&R),这是一种递归记忆方法,可以学习记忆函数 $m_t = M(h_t)$ 并扩展到长上下文,同时保持轻量级计算。它涉及两种策略:(1)将整个历史记录的选择递归地划分为 $2K$ 词元上的顶级 $K$ 选择的子问题,以便端到端学习的固定大小的轻量级选择器支持无界历史记录; (2)所有递归块共享一个选择器,它捕获每个块公共的选择规则并保持方法的效率。 RoboMME 是 16 项长期操作任务的基准,需要记住何时、何地、做什么以及如何行动,D&R 实现了最先进的平均成功率,并且在仅 64 个词元的预算下,所有四个套件都获得了一致的收益;真实的机器人实验显示出相同的增益。代码、检查点和更多结果位于 https://dnr-memory.github.io/