论文
超越未来预测:去噪作为机器人控制的生成适应
Beyond Future Prediction: Denoising as Generative Adaptation for Robot Control
摘要
预训练的生成扩散Transformer (DiT) 通过大规模图像和视频生成训练来捕获丰富的像素级视觉和语言条件结构。越来越多的机器人策略建立在这种生成先验的基础上,但如何将其转移到控制仍不清楚,现有的方法通常通过未来的视觉预测来实例化这种转移。我们提出一个更基本的问题:预训练的生成 DiT 实际上对动作学习有何贡献,以及如何调整该先验以进行控制。我们引入了 NowWAM,这是一种未来无目标的协同训练公式,可以对当前观察进行去噪,并从同一视觉流中预测机器人动作,直接将本机生成目标与去噪轨迹上面向动作的表示耦合起来。在匹配的受控设置下,过去和未来的视觉目标表现相当,而将训练限制在干净的终点会大大降低鲁棒性,这表明单独的未来目标对于生成适应并不重要,而去噪轨迹仍然是控制的有效界面。在 LIBERO-Plus 上,NowWAM 通过 FLUX2-Klein 达到 87.7%,比未来目标协同训练基线提高了 6.1 个点,同时将训练视觉标记减半(784 到 392),并将步骤时间从 2.85 秒减少到 1.63 秒,加速了 1.8 倍。凭借纯文本到图像的 Z-Image 主干,NowWAM 进一步达到 87.8%,这表明强大的控制适应与视频生成或图像编辑主干无关。