论文
测试时训练作为机器人策略的剩余记忆
Test-Time Training as Residual Memory for Robot Policies
摘要
记忆对于长视野机器人操作至关重要,其中成功的操作可能取决于无法从当前观察中恢复的过去事件。然而,随着回合变得越来越长,保留完整历史记录的成本越来越高,这给记忆增强型策略带来了根本性的可扩展性挑战。现有方法通过将选定的过去观察结果存储在有界的记忆库中或通过测试时训练 (TTT) 将交互历史压缩为固定大小的参数状态来解决这一挑战。然而,这些表述并没有明确区分已经可以从策略当前上下文中恢复的历史信息和必须在其当前上下文中保留的信息。我们引入了 TTT-RM,它将 TTT 重新调整为残差记忆,使用快速权重不是一般性地压缩历史记录,而是通过保留无法从策略当前上下文中恢复的任务相关历史信息来补充有界记忆库。具体来说,TTT-RM 学习一个历史解码器,该解码器根据当前观察重建历史表示并检索记忆。由此产生的重建残差捕获了上下文无法解释的内容,并作为 TTT 的学习目标。 TTT 慢速权重针对此残差目标进行了优化,以便在线快速权重更新能够随着时间的推移学习对互补历史信息进行编码。然后查询快速权重状态以生成决定动作生成的剩余记忆表示。对记忆密集型仿真基准和实际任务的大量实验表明,TTT-RM 在多个记忆设计中持续改进,优于不同的基准,并支持持续执行三分钟、八阶段的装载任务。
