论文
RoboTTT:机器人策略的上下文扩展
RoboTTT: Context Scaling for Robot Policies
摘要
最近的机器人基础模型在单步或短历史视觉运动环境下运行。我们引入了测试时间训练机器人策略 (RoboTTT),这是一种机器人模型和训练方法,可将视觉运动上下文扩展到 8K 时间步长,比最先进的策略高出三个数量级,并且不会增加推理延迟。在这个上下文长度下,我们解锁了新的机器人功能:从人类视频演示中进行一次性上下文模仿、动态策略改进、对扰动的鲁棒性以及在多阶段、长期任务上的更强性能。我们还首次观察到,随着预训练上下文长度的增加,闭环性能稳步提高。 RoboTTT 的核心是将测试时训练集成到机器人基础模型(例如视觉-语言-动作策略)中,生成一个序列模型,其循环状态由快速权重、训练和推理期间梯度下降更新的参数、将历史压缩到权重空间并检索用于长上下文调节的上下文信息组成。为了扩展训练上下文的长度,该方法将序列动作强制与随时间截断的反向传播结合起来。在具有挑战性的真实机器人操作任务中,RoboTTT 的整体性能比单步上下文基线提高了 87%,并完全完成了 5 分钟、10 阶段的组装任务,这是任何基线都无法做到的。使用 8K 时间步长上下文训练的 RoboTTT 比使用 1K 时间步长预训练的相同模型性能高出 62%,这表明上下文长度可以作为机器人基础模型的新缩放轴。视频可在 https://research.nvidia.com/labs/gear/robottt/ 获取