论文
PiL-World:用于 VLA 策略在环评估的分块世界模型
PiL-World: A Chunk-Wise World Model for VLA Policy-in-the-Loop Evaluation
摘要
视觉-语言-动作(VLA)策略在现实世界的机器人任务中以闭环方式运行:机器人观察场景,执行动作块,并根据观察结果做出下一个决策。然而,大多数现有的机器人动作评估世界模型仅限于沿着预先收集的动作轨迹进行开环预测。这使得它们无法支持闭环 VLA 评估,其中每个操作块必须以先前执行生成的观察结果为条件。为了解决这一差距,我们提出了 PiL-World,这是一种专为策略循环 VLA 评估而设计的分块世界模型。给定 VLA 策略执行轨迹的当前观察结果和行动轨迹,PiL-World 会生成与 VLA 策略执行轨迹一致的多视图未来观察结果,并与策略所需的图像输入相匹配。通过交替使用 VLA 推理和世界模型预测,PiL-World 可以实现闭环评估,而无需在每一步执行真正的机器人执行。为了提高执行轨迹保真度,PiL-World 根据头视机器人运动的动作衍生视觉控制和编码任务执行上下文的潜在历史来调节视频生成,同时联合预测互补的多视图观察。除了成功的远程操作演示之外,它还从失败的执行轨迹中学习,帮助模拟执行轨迹更好地匹配实际政策执行的分布。我们在三个真实的双臂操作任务上评估 PiL-World。 PiL-World 生成与真实机器人执行高度一致的想象部署。更重要的是,与基线相比,它将现实世界中测量的 VLA 成功率与通过闭环世界模型评估估计的 VLA 成功率之间的误差从 63.2% 减少到 12.0%。