论文

执行前重新思考:世界行动模型的自适应执行

Rethink Before You Execute: Adaptive Execution for World Action Models

智能体系统Agent 环境交互

摘要

世界行动模型(WAM)共同预测未来的行动和环境的演变。每次推理时,WAM 都会生成一大块动作,机器人在重新规划之前执行固定的前缀。我们认为,这种固定的执行范围与执行动态不太匹配:块的可靠性在不同的任务阶段有所不同,因此何时重新计划取决于累积执行的结果,而不是步骤计数。我们提出了 TempoWAM(在线监​​控进度定时执行),这是一种轻量级的 WAM 即插即用执行方案。循环进度监视器首先根据当前观察、任务指令、剩余操作和执行历史来估计任务进度;然后,自适应执行协议评估该块是否正在推进任务,以决定是否需要重新规划。为了弥补训练与部署之间的差距,该协议通过在线适应的任务相关校准因子进行校准。对 LIBERO、RoboTwin 和实际任务的实验表明,TempoWAM 持续改进了 WAM 执行的效率与成功权衡。在真实的机器人上,它在保持成功的同时,将简单任务的 WAM 推理量减少了 26.9%,将困难任务的成功率提高了 13.3 点。