论文

WAM-TTT:通过在测试时观察人类游戏来引导世界动作模型

WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time

模型训练持续学习

摘要

引导机器人基础模型 (RFM) 实现新的任务变体或用户偏好的行为仍然具有挑战性,通常需要额外的机器人演示、特定于任务的 微调 或长上下文调节。我们推出了 WAM-TTT,这是一个测试时训练框架,用于根据原始人类视频引导世界动作模型。 WAM-TTT 并没有将人类视频视为要模仿的轨迹,而是通过自监督视频预测将它们吸收到冻结的 WAM 内的轻量级自适应存储器中。为了使这种记忆对控制有用,我们引入了一个元训练阶段,该阶段使用配对的人机数据和键值记忆重建目标将人类演示与机器人行为结合起来。在测试时,只需要未标记的人类视频来适应记忆,而预训练的 WAM 保持冻结状态。这可以实现高效且可重复使用的转向,无需机器人动作、人为注释或特定于任务的 微调,同时保留基础模型的泛化能力。大量实验表明,WAM-TTT 在不同的操作任务和泛化设置中始终优于上下文中的人类视频调节基线。