论文
DIDO:将以交互为中心的动力学提炼为世界行动模型的一步去噪
DIDO: Distilling Interaction-Centric Dynamics into One-Step Denoising for World Action Models
摘要
世界动作模型 (WAM) 使用视频生成模型来预测机器人操作的未来视觉动态,但迭代降噪会给闭环控制带来额外的延迟。我们凭经验发现,视觉内容在去噪过程中以不同的速率收敛。静态背景结构很早就形成,而抓手和被操纵的物体在第一步之后仍然模糊,它们的相互作用动态只有通过随后的去噪才能显现出来。因此,天真地将多步视频模型截断为一步可以保留场景结构,但会失去对操作最关键的以交互为中心的动态。为了解决这个问题,我们提出了 DIDO,它将多步视频模型的收敛动态提炼为单个去噪步骤。 DIDO 将分布匹配蒸馏与以交互为中心的表示指导相结合。除了将多步生成压缩为一次前向传递之外,DIDO 还使用监督边界框视觉推理标记显式地对夹具、被操纵对象及其交互进行建模。此外,DIDO 将多个模型层中目标对象的表示与预训练的 DINOv3 编码器的特征进行对齐。这种以交互为中心的指导有助于蒸馏模型一步保留相关实体及其未来动态,同时大幅减少推理延迟。 DIDO 在 LIBERO 上的平均成功率达到 99.0%,在 LIBERO-Plus 上达到 76.6%,在 RoboTwin 上达到 92.0%,同时还展示了向现实世界机器人操作中的长视野和泛化任务的有效迁移。