论文

AutodidactWAM:从生成视频跨模态蒸馏机器人动作

AutodidactWAM: Cross-Modal Self-Distillation from Generated Video to Robot Actions

摘要

Cosmos 3 等世界动作模型 (WAM) 根据观察和指令共同生成未来的视频和机器人动作。将具有轻量级 LoRA 微调的此类模型应用于以前从未见过的机器人(具有五指 BrainCo 手的 Unitree G1 人形机器人),暴露了视频动作不对称性:视频呈现合理的任务执行,而共同生成的动作则系统性地错误定位。我们评估三个累积阶段的闭环真实机器人试验:预抓取、抓取和拾放。本机操作的成功率分别约为 17%、10% 和 7%,并且在 保留测试 对象上表现较差。我们提出了 AutodidactWAM,一种无需远程操作即可训练的手部姿势估计器,然后是逆运动学,在模型生成的视频上运行以恢复动作估计。与本机预测配合使用,这些恢复的动作仅为与动作相关的层的微调提供首选目标,而生成的视频是 教师模型 强制的。我们将监督重标记与 Diffusion-DPO 的整流流适应进行了比较。在一次性实施例适应之后,自蒸馏不需要额外的特定于任务的远程操作。恢复动作门的预抓握、抓握和拾放成功率约为 75%、47% 和 42%,而原生动作的成功率分别为 17%、10% 和 7%。结合偏好监督、监督目标拟合和笛卡尔轨迹锚定 (DPO+SFT+DTW) 的混合目标表现最佳:在 Oreo、训练对象上,它达到 90% 的预抓取和 20% 的全 任务成功率;在 保留测试 对象上,它达到 80% 和 30%。尽管验证偏好准确度为 1.000,Plain Flow-DPO 仍达到 0% 成功,这表明训练目标的组合,而不是单独的对比目标,推动了观察到的收益。

AutodidactWAM:从生成视频跨模态蒸馏机器人动作:论文原图
图 2:AutodidactWAM 管道。 1、生成一对自蒸馏对(联合Cosmos 3 执行轨迹):从锚框$I_{0}$和提示/种子、回合$k$、策略、$\theta_{k-1}$(A)共同产生视频$V$(B)和原生动作$a^{-}$; $V$经过RoboHaMeR${+}$IK、$\Phi(V)$,恢复位姿(C)和轨迹$\hat{a}$,与回合开始预测$a_{0}$混合成目标$a^{+}=0.8\,\hat{a}+0.2\,a_{0}$;每 $K$ 步骤都会从更新的策略刷新该对(第 III-B 节)。 2、仅优化与动作相关的层(教师模型-强制视频、共享噪声):EMA参考$\theta_{\mathrm{ref}}$和可训练策略 $\theta_{k,i}$(LoRA${+}$action接口)得分$(a^{+},a^{-})$,给出流匹配残差$\Delta_{\theta},\Delta_{\mathrm{ref}}$;组合目标 $\alpha_{\mathrm{DPO}}\mathcal{L}_{\mathrm{DPO}}+\alpha_{\mathrm{SFT}}\mathcal{L}_{\mathrm{SFT}}+\alpha_{\mathrm{DTW}}\mathcal{L}_{\mathrm{DTW}}$(方程(2))被反向传播到策略,其 EMA 更新参考;更新后的策略 (D) 部署用于实际机器人执行。