论文
长视野机器人控制的视觉运动策略中的记忆检索
Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control
摘要
在部分可观察的环境(例如家庭)中运行的通用机器人需要内存来支持自主性。他们必须回忆起过去的各种信息,例如物体放置的位置、人类伙伴完成了哪些任务以及设备何时打开。实现这种多功能性需要通用的内存检索机制。使用长上下文注意力进行记忆检索的 Transformer 架构提供了一种有前景的方法,因为它们从数据中学习检索,而不是依赖于特定于任务或手工设计的规则。然而,直接将它们纳入离线数据的模仿学习中会带来两个关键挑战:(1)策略可能会学习过去信息和预测行为之间的虚假相关性,(2)由于预测不准确及其与环境的复合相互作用,错误会在内存中累积,导致模型漂移和级联故障。为了解决这两个挑战,我们引入了 HALO,这是一种视觉运动策略,具有基于注意力的记忆检索机制,用于长视野控制。首先,为了抑制虚假相关性,HALO 将视觉语言模型(VLM)先验提炼到策略中。它从演示轨迹生成依赖于记忆的问答对,并与视频问答目标联合训练,引导检索任务相关信息。其次,为了减少闭环控制期间内存中累积错误的影响,HALO 使用稀疏注意力,将检索限制为仅历史记录中最相关的部分。这些组件共同指导策略从长达八分钟的过去经验中检索与任务相关的信息,从而实现更可靠的长期控制。项目网站:https://robin-lab.cs.utexas.edu/HALO