论文
SANTS:世界行动模型的状态自适应调度程序
SANTS: A State-Adaptive Scheduler for World Action Models
摘要
世界动作模型 (WAM) 通过使用基于视频的未来表示来调节动作生成,从而改进机器人操作。然而,在像素空间 WAM 中,最佳动作条件不一定是完全去噪的视频。受控去噪深度扫描表明,视频细化可以将动作误差减少到与状态相关的点,之后当后期预测变得不太与动作相关或物理上不可靠时,增益可能会饱和甚至逆转。这表明动作生成应该使用视频噪声轨迹上的状态相关点,而不是固定的终端去噪深度。我们引入了状态自适应噪声轨迹调度程序(SANTS),这是一种用于视频到动作扩散策略的轻量级调度程序。在每个视频决策点,SANTS 读取当前视频状态表示和噪声水平,然后联合预测累积停止危险和相对噪声进展比。 SANTS 是在冻结动作分支生成最终动作块后计算出的路径级奖励进行后训练的,因此调度程序针对下游动作质量而不是中间视频保真度进行优化,同时冗余视频状态更新会受到明确的惩罚。实验表明,SANTS 在 RoboTwin 2.0 上取得了 \(94.4\%\) 总体成功率,在七个真实机器人任务中取得了 \(73.1\%\) 平均成功率,同时相对于完整视频去噪,延迟分别减少了 \(81.7\%\) 和 \(79.0\%\)。这些结果表明,沿视频噪声轨迹的自适应选择可以保留 WAM 式未来推理的控制优势,同时消除其大部分冗余推理成本。