论文

WAM-OPD:世界动作模型的同策略蒸馏

WAM-OPD: On-Policy Distillation for World Action Models

摘要

世界动作模型(WAM)将视觉未来预测与机器人动作生成耦合在一起,但加速后的学生模型可能在蒸馏过程中丢失任务能力,并在之后遇到离线数据中表征不佳的状态。我们研究同策略蒸馏(OPD)能否在不需要稀疏奖励强化学习的情况下修复这样的学生模型。我们提出WAM-OPD,一个面向视频优先WAM的、与部署一致的后期训练方案。学生在环境中行动,因此由学生自身决定历史分布;一个冻结的教师为这些学生历史标注连贯的视频与动作目标,而学生动作分支则在其自身生成的视频规划下训练,正如部署时那样。视频与动作联合损失更新共享主干中的轻量适配器,并辅以动作流匹配正则项。在RoboTwin 2.0上针对两个任务的初步研究中,已发布的一视频/一步动作Flash-WAM在HANDOVER MIC上的成功率从0.0%提升到58.3%,在PUT OBJECT CABINET上从16.7%提升到33.3%。这些面向特定任务的结果只是初步的能力证明,而非广泛或均匀泛化的证据。尽管如此,它们表明在学生引发的历史上施加密集教师监督,是视频优先WAM的一种有前景的后期训练接口。

WAM-OPD:世界动作模型的在策略蒸馏:论文配图
图1:WAM-OPD 概览。仅由学生在环境中行动并决定历史分布。冻结的教师为每条学生历史标注连贯的视频与动作目标。学生的动作分支消耗其自身的停梯度视频规划,与部署时一致。视频、动作与流匹配损失仅更新共享学生块中的 JointLoRA 参数。精确目标函数见式 9。