论文
世界相干解码:世界行动模型的自我验证测试时间规划
World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models
摘要
世界动作模型(WAM)旨在通过随机生成视觉未来然后解码动作来控制机器人,但经验观察表明结果很大程度上取决于选择的未来。我们提出了世界相干解码 (WCD),这是一种自我验证的测试时间规划框架,它将 WAM的预测轨迹视为可证伪的未来行动假设。在每个决策步骤中,WCD 从冻结的 WAM 中对多个候选者进行采样,并使用内部生成信号对它们进行排名:基于流的视频惊喜可实现视觉可信度,动作路径努力可实现动作生成稳定性。执行后,实现的观察会审核所选的想象,产生想象与现实的不匹配,为未来的候选人选择训练轻量级在线预测器。因此,WCD 将延迟的自验证转换为执行前的可靠性估计,而无需更新骨干模型。在 RoboTwin 2.0 上,WCD 将有限随机场景监督下的硬成功率从 $55.80\%$ 提高到 $60.90\%$,在 Horizon-3 任务上获得 $+16.43$ 收益,并在真实 Franka 视觉转移测试中显示出定性鲁棒性。这些结果强调了一个简单的原则:WAM 的测试时间扩展更多地取决于选择可靠的未来,而不是对更多未来进行采样。