论文
为长期任务扩展视觉运动策略的短期记忆
Scaling Short-Term Memory of Visuomotor Policies for Long-Horizon Tasks
摘要
许多机器人任务都需要短期记忆,无论是检索不再可见的物体还是在一段时间后关闭电器。然而,大多数通过模仿学习训练的视觉运动策略仅依赖于即时的感觉输入,而不使用过去的经验来指导决策。我们提出了 PRISM,一种基于 Transformer 的视觉运动策略架构,通过两个关键组件有效地使用短期记忆:(i)门控注意力,过滤检索到的信息以抑制不相关的细节,通过减少历史和当前动作预测之间的虚假相关性来提高性能;(ii)分层架构,首先将本地信息压缩为紧凑的词元,然后将它们集成以捕获时间扩展的依赖关系,从而改善其计算和内存占用。这些机制共同使我们能够将视觉运动策略中的短期记忆扩展至长达两分钟。为了系统地评估视觉运动控制中的记忆,我们引入了 ReMemBench——涵盖四类短期记忆的八种不同家庭操作任务的基准——旨在培养一般记忆机制,而不是孤立的、特定于任务的解决方案。 PRISM 始终优于先前的工作,包括循环架构、Transformer 及其变体——与最强基线相比,绝对提高了 5%--12%。在 RoboCasa 和 LIBERO 基准测试中,尽管没有利用任何大规模预训练,但它比无内存变体和微调的视觉-语言-动作基线(例如 GR00T-N1-3B 和 OpenVLA)实现了 11%--15% 的绝对改进。 PRISM 和 ReMemBench 共同为开发和评估可扩展到长期任务的短期记忆增强视觉运动策略奠定了基础。其他材料可在 https://shahrutav.github.io/short-term-memory 获取