论文
AutodidactWAM:从生成视频跨模态蒸馏机器人动作
AutodidactWAM: Cross-Modal Self-Distillation from Generated Video to Robot Actions
摘要
Cosmos 3 等世界动作模型 (WAM) 根据观察和指令共同生成未来的视频和机器人动作。将具有轻量级 LoRA 微调的此类模型应用于以前从未见过的机器人(具有五指 BrainCo 手的 Unitree G1 人形机器人),暴露了视频动作不对称性:视频呈现合理的任务执行,而共同生成的动作则系统性地错误定位。我们评估三个累积阶段的闭环真实机器人试验:预抓取、抓取和拾放。本机操作的成功率分别约为 17%、10% 和 7%,并且在 保留测试 对象上表现较差。我们提出了 AutodidactWAM,一种无需远程操作即可训练的手部姿势估计器,然后是逆运动学,在模型生成的视频上运行以恢复动作估计。与本机预测配合使用,这些恢复的动作仅为与动作相关的层的微调提供首选目标,而生成的视频是 教师模型 强制的。我们将监督重标记与 Diffusion-DPO 的整流流适应进行了比较。在一次性实施例适应之后,自蒸馏不需要额外的特定于任务的远程操作。恢复动作门的预抓握、抓握和拾放成功率约为 75%、47% 和 42%,而原生动作的成功率分别为 17%、10% 和 7%。结合偏好监督、监督目标拟合和笛卡尔轨迹锚定 (DPO+SFT+DTW) 的混合目标表现最佳:在 Oreo、训练对象上,它达到 90% 的预抓取和 20% 的全 任务成功率;在 保留测试 对象上,它达到 80% 和 30%。尽管验证偏好准确度为 1.000,Plain Flow-DPO 仍达到 0% 成功,这表明训练目标的组合,而不是单独的对比目标,推动了观察到的收益。
