论文

T$^2$Mem:学习机器人测试时记忆

T$^2$Mem: Learning Test-Time Memory for Robotics

摘要

依赖于记忆的机器人操作需要策略来使用当前观察中不再可用的信息。仅保留历史是不够的:记忆必须保留支持未来行动的信息。一个挑战是无记忆基础模型是否可以在没有外部记忆支持的情况下仅学习保留和使用来自动作演示的历史信息。我们引入了 T$^2$Mem,这是一个在预训练的视觉-语言-动作策略中开发此功能的框架,无需外部推理模型或特定于内存的注释。 T$^2$Mem 使用测试时训练,通过在线自监督更新将观察历史记录编码为紧凑的快速权重,避免重复处理完整历史记录。基于观察的界面提取用于记忆形成的视觉语言信息,并将检索到的上下文提供给行动专家。动作监督决定了记忆学习保留和使用的内容,而交替记忆策略学习在优化过程中为每个组件提供了固定的对应部分。在 16 个 RoboMME 任务中,T$^2$Mem 比无内存基本策略将平均成功率从 17.93% 提高到 56.83%,并且优于基准测试中报告的循环内存方法,而受控分析表明推理速度比显式方法至少提高 3 倍。项目网址:https://yzliu84.github.io/T2MEM-project/