论文
NoiseGate:学习每个潜在时间步长计划作为世界行动模型中的信息门控
NoiseGate: Learning Per-Latent Timestep Schedules as Information Gating in World Action Models
摘要
世界行动模型 (WAM) 是一系列新兴政策,将机器人行动生成与未来观察建模联系起来。在这项工作中,我们专注于联合视频-动作建模范例,其中动作和想象的未来观察沿着共享的去噪或流动轨迹共同生成,以便感知、预测和控制在一个生成过程中耦合。现有的 WAM 通常通过 Mixture-of-Transformer (MoT) 来实现这种范例,其中视频和动作词元通过共享的自注意力进行交互。该架构原则上可以为每个预测的潜在帧分配单独的时间步 $t_f$,但当前系统将此自由度折叠到单个共享标量 $t$ 上。在扩散强迫的噪声掩蔽视图下,这种共享时间表强加了不合理的先验,即每个预测的潜在变量对于动作生成来说都是同样可靠的。相反,我们将每个潜在的调度视为\emph{可学习的信息门控策略}:通过改变潜在帧的噪声水平,该策略调节其键/值对动作词元贡献的可靠性。我们提出 \textbf{NoiseGate},它结合了骨干训练期间独立的每潜在时间步采样、在去噪过程中发出每潜在时间增量的轻量级门控策略网络,以及在没有手工设计的形状先验的情况下训练调度策略的任务奖励优化。 NoiseGate 建立在联合视频-动作 MoT 主干之上,可为各种 RoboTwin 随机场景操作任务提供一致的增益。