论文

MemBodied:视觉-语言-动作模型的循环联想记忆

MemBodied: Recurrent Associative Memory for Vision-Language-Action Models

上下文与知识上下文工程

摘要

视觉-语言-动作模型为通用机器人控制提供了坚实的基础,但绝大多数策略并没有保留和利用当前观察范围之外的事件级信息。这种限制在依赖于历史的操作任务中是很重要的,这些任务依赖于仅在过去观察中可用的信息。在上下文中保留过去的观察结果有助于恢复这些信息,但代价是不断增长、臃肿的上下文和推理延迟。因此,我们引入了 MemBodied,一种固定大小的情景记忆,具有两个互补的组件:记录策略调用之间交互的关联状态和保留初始场景的紧凑表示作为参考的情景锚点。在每次策略调用时,模型都会根据当前输入和内存组件条件生成动作,而不是直接使用过去的观察结果。在五个需要内存的 RMBench 评估任务中,MemBodied 实现了无状态策略的平均成功率 $7.81\times$ 和普通循环内存的 $2.98\times$,同时在添加参数少了 $10\times$ 的情况下,比最强的内存增强基线高出 $1.3\times$。在完全可观察的 LIBERO-Long 套件上,它达到了 90.6%,比无状态 $\pi_0$ 策略提高了 5.4%。这些发现支持 MemBodied 作为扩大依赖历史的操纵的政策背景的实用替代方案。