论文

Flash-WAM:世界动作模型的模态感知 蒸馏

Flash-WAM: Modality-Aware Distillation for World Action Models

模型推理推理加速

摘要

世界动作模型(WAM)通过迭代扩散联合生成未来的视频和机器人动作,在操纵基准上实现了强大的性能,但需要数十个降噪步骤,这一成本阻碍了实时控制。步骤 蒸馏 已成为自然补救措施,但现成的方法在联合视频动作设置中会崩溃,因为视频和动作流使用不同的 SNR 偏移噪声计划并以显着不同的边缘噪声分布进行训练,这是单模态 蒸馏 方法无法适应的不对称性。我们引入 \textbf{Flash-WAM},一个模态感知的步骤 蒸馏 框架,其灵感来自于一致性 蒸馏,它为每个模态选择一致性函数以匹配其噪声范围:动作流的低噪声范围的线性梯度缩放参数化,与视频流的高噪声范围的方差保留参数化配对,基于以下结构分析:一致性函数族,表征一致性边界条件下可实现的梯度缩放。 Flash-WAM 在 LingBot-VA 上实例化,将推理压缩为每种模态中的单个步骤。在 RoboTwin 2.0 上,这将 NVIDIA L40S 上的每块延迟从 8.1秒减少到 348毫秒,加速了 23倍,从而实现了实时推理。 Flash-WAM 在模拟基准上保留了任务成功率($85.5\%$ RoboTwin 2.0、$95.7\%$ LIBERO),并大幅恢复了现实世界的性能(Unitree G1 人形机器人平均为 $60\%$),而朴素一致性 蒸馏 在相同的步骤预算下降至 $24\%$。