论文

ΔWAM:将动作对未来的局部影响蒸馏进世界动作模型

ΔWAM: Distilling Action Tangent Fields into World Action Models

摘要

世界动作模型(WAM)通过增强稀疏动作监督和密集的未来预测来改进机器人策略。然而,大部分可预测的未来都是由外观和场景持久性主导,而不是依赖于动作的动态。我们观察到,最近的几种 WAM 设计,包括光流、以运动为中心的表示和潜在动作,可以从一个共同的角度来理解,其中世界监督变得更加有效,因为它包含更高比例的与动作相关的变化。基于这一见解,我们引入了行动切线场,它通过行动如何引起未来动态变化的局部泰勒展开来重新制定世界监督。我们在残差 VAE 空间中表示未来动态,其中未来潜伏仍然可以从当前潜伏及其残差中恢复,并使用强动作条件世界模型(ACWM)来探测动作变化和残差世界变化之间的局部对应关系。这种局部一阶结构被提炼到 WAM 中,以指导其动态降噪监督 与行动更紧密地结合,而不仅仅是从外观上可预测。在 LIBERO-Plus、RoboTwin 和 RoboTwin2.0-Plus 中,我们的方法不断提高对照明、背景、相机、布局和其他环境扰动的鲁棒性。尽管没有使用大规模的体现预训练,但它在多个分布变化下比预训练策略实现了更强的鲁棒性。我们进一步将多步骤 VideoDiT 去噪提炼为单个步骤,以实现高效推理。我们的结果表明,有效的 WAM 监督应该保持信息丰富,同时将其预测能力集中在行动改变未来的方向上。

ΔWAM:将动作对未来的局部影响蒸馏进世界动作模型:论文原图
图 2:Δ\DeltaWAM 概述。 Wan VideoDiT-5B 经过中期训练,可以预测 Residual-VAE 未来 Rt+1:t+HR_{t+1:t+H}。然后在KK扰动动作处查询特定于实施例的ACWM,并且其归一化响应差异被正交归一化为本地动作敏感方向的高速缓存基础GtG_{t}。训练后将真实残差保留为目标,并惩罚其在 GtG_{t} 上的投影,tv=0t_{v}=0 处的一次 VideoDiT 传递条件为推理时的四个 ActionDiT Euler 步骤。