论文
零 WAM:基于人类视频的上下文世界动作建模,用于开放式任务泛化
Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
摘要
零样本跨任务泛化(即策略必须执行训练期间从未见过的操作任务)仍然是机器人学习的核心挑战。在大语言模型中,只需在上下文中指定新任务即可执行,无需任何参数更新。这种形式的情境学习(ICL)将泛化转化为任务规范问题。为了实现跨任务泛化,我们将这种范式引入机器人操作中,并认为操作的自然任务规范是人类视频:与语言不同,它提供了有关预期任务演变的丰富视觉线索。我们提出了 Zero-WAM,这是一种因果视频动作模型,它通过遵循上下文中的人类视频指导来执行看不见的任务。为了解决任务丰富的配对人类机器人数据的稀缺问题,我们提出了一种自动管道,可将任务采样的机器人轨迹转换为语义匹配的人类视频,生成 HumanGen,这是一个跨 8.6K 任务的 74.2K 人类机器人 ICL 对的数据集。对于 模型训练,我们进一步引入了上下文中的未来块预测(IFP)目标,该目标抑制从已见任务中学到的快捷方式,并强制策略从视频提示中提取任务信息。在 RoboTwin 2.0 模拟中的 7 个看不见的任务中,Zero-WAM 实现了 47.0% 的平均成功率,比最强的视频动作基线绝对提高了 29.5 个百分点。在现实世界的评估中,它遵循人类视频指导来泛化到涉及多对象场景、长视野操作和细粒度插入的看不见的任务配置。