论文

通过零样本几何评估来缩放世界行动模型的测试时间

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

模型推理测试时计算扩展

摘要

测试时间缩放通过花费额外的计算来改进基础模型推理,但机器人控制需要在执行操作之前决定额外的计算是否有用。世界行动模型 (WAM) 使这一决策变得自然:每次预测轨迹都会公开一个行动块和预测的未来观察结果。我们提出了一个用于 WAM 的 无需训练 选择性测试时间扩展框架 \methodated。我们首先实例化 \method,一个固定预算 Best-of-$N$ 选择器,通过使用冻结几何基础模型计算的预测未来的交叉视图深度重投影一致性来对采样的预测轨迹进行排名。 \methodated\ 添加了一个轻量级操作——未来一致性门,仅当初始预测轨迹出现内部不一致时才调用 \method\。在 RoboCasa、LIBERO Long 和 RoboTwin~2.0 上的五个基准-骨干设置中,固定预算\方法\在每个设置中提高了 $N{=}8$ 任务成功率,例如,使用 Cosmos 策略将 RoboCasa 组平均从 $66.3\%$ 提高到 $68.4\%$,使用 X-WAM 从 $80.8\%$ 提高到 $82.5\%$。启用门控后,\methodated\ 平均恢复 $74.8\%$ 的始终在线成功增益,同时仅在 $26.2\%$ 的决策点上触发额外采样。离线诊断表明,跨视图重投影是一种强大的无任务标签选择器,我们将错误的低分选择识别为一种故障模式,有助于解释为什么性能会随着 $N$ 的增加而饱和或下降。