论文
楼梯策略:具有大动作块的世界动作模型的流式推理
Staircase Policy: Streaming Inference for World-Action Models with Large Action Chunks
摘要
世界动作模型 (WAM) 通过根据预测的未来观察来调节动作生成,从而改进机器人操作,但未来的预测会进一步增加本已昂贵的迭代动作生成的推理开销。操作分块可以通过多个操作分摊此成本,但在长期执行范围内性能会下降,因为后续操作仍然以陈旧的观察为条件。我们引入了 STAIRCASE POLICY,这是一种流式推理和训练框架,它将流匹配 VLA 转换为 JEPA 风格的 WAM,并在交错的去噪阶段将大动作块划分为子块。近期行动一旦可用就会立即执行,而后续行动则继续完善。在每个子块边界,根据最新的观察结果重新预测未来潜在变量,并用于更新所有未执行的操作,从而无需重复完整的策略推理即可实现长范围执行。由此产生的未来预测误差可以进一步充当自适应分块的信号。 S-WAM 在 LIBERO 上实现了 97.7%,在 LIBERO-Plus 上实现了 87.9%,并提高了多个策略主干和真实机器人任务的性能。它每秒执行 292.7 个操作,是同等精度下传统执行吞吐量的 3.62 美元\倍$,同时将首次操作时间从 123.6 毫秒减少到 73.3 毫秒。通过额外的推理优化,吞吐量进一步增加至每秒 642.9 个操作。