论文
EgoWAM:超越像素的世界行动模型与野外以自我为中心的人类数据
EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data
摘要
以自我为中心的人类数据为机器人操作提供了可扩展的监督。然而,行为克隆将可转移的内容(如对象、场景和任务语义)与不可转移的因素(如人类形态、头部运动和行为风格)纠缠在一起。我们研究世界行动模型(WAM)是否通过要求策略不仅预测行动,而且预测场景如何演变来提供更好的训练信号。核心问题是哪种世界表征最能实现人机转换。我们假设一个有效的世界目标应该抽象外观,捕捉代理不变的物理效果,并将相机运动与环境变化分开。我们引入了 EgoWAM,一种受控的人机协同训练框架,它修复了策略主干、动作头和数据混合,同时仅改变世界预测目标,比较 Pixel、DINO 和 3D 运动流。在三个现实世界的双手任务中,WAM 协同训练可以比行为克隆更有效地利用野外的以自我为中心的人类数据进行扩展。基于像素的预测传输较弱,而 DINO 和 3D flow 产生了显着的收益:DINO 将分布外对象和场景泛化提高了 4 倍,3D flow 将域内性能提高了 20-30%。更多详情:https://gatech-rl2.github.io/egowam.github.io