论文
DyMD:视频世界模型蒸馏中保留交互运动
DyMD: Preserving Interaction Dynamics through Distribution Matching Distillation in Few-Step Video World Models
摘要
大型视频扩散模型为具身预测和学习提供了富有表现力的先验,但其多步采样对于交互式下游使用来说仍然成本高昂。分布匹配蒸馏 (DMD) 可以实现几步视频生成,但可以抑制机器人物体运动,同时保持视觉质量。检查 DMD 的教师信号和假分数信号,我们发现弱的重新噪声使教师后验集中在运动缺陷的生成轨迹附近,从而限制了运动恢复指导。同时,更强的运动生成轨迹往往会产生更大的假分数拟合误差,这可能会阻碍生成器对交互动力学的学习。我们提出了 DyMD,这是一个 DMD 框架,可以适应教师监督和判别网络的需求,以适应不断发展的学生。时间亲和力条件再噪声采样通过将基本时间表与受局部后验变化激励的教师先验混合来使时间步分布适应每个生成轨迹的当前交互保真度,从而平衡运动恢复和外观细化。为了更好地跟踪更强的运动生成轨迹,动态引导的假分数跟踪使用噪声条件预测器来从潜在的时间动态中估计与噪声相关的拟合难度,然后在判别网络损失中增加预测的硬生成轨迹的权重。使用 DyMD,我们将 14B 教师提炼为四步 1.3B 学生,推理时没有辅助模块。在具身视频基准测试中,与 Base DMD 相比,学生将 R-Bench 任务依从性提高了 9.6 个百分点,PAI-Bench-G 域得分提高了 5.1 个百分点,同时保持了相当的视觉质量。作为下游行动计划的支柱,我们的学生在两项 WorldArena 任务中取得了 34% 的平均成功率,而 Base DMD 的平均成功率为 16%。
