论文

CheckVLA:使用动作条件世界模型进行长视野移动操作的执行时验证

CheckVLA: Execution-Time Verification with Action-Conditioned World Model for Long-Horizon Mobile Manipulation

智能体系统Agent 动作执行与治理

摘要

视觉-语言-动作(VLA)策略通常通过开环动作块执行长视野移动操作,在不接收新的高级视觉输入的情况下发出多个动作。因此,提交的块意味着观察应该如何演变,但意外偏差可能会违反此期望,而其余操作会继续传播错误:提交时策略信心无法对调度后发生的偏差做出反应,并且仅观察的异常分数缺乏用于区分预期效果和无法解释的变化的操作条件参考。我们提出了 CheckVLA,它使用单独训练的、冻结的动作条件世界模型来验证执行情况。一致校准的风险阈值限制了不必要的首次干预的事件级概率,并确定何时进行干预,其超出控制了重写后缀保留被取代块的强度,延迟感知硬前缀限制了对仍然可部署的操作的替换,事件驱动的关键帧库保留了先前修复进展的证据。在 RoboCasa365 上,在通用训练方案和匹配的调用预算下,CheckVLA 获得了 36.1% 的平均成功率,而定期重新规划的平均成功率为 27.6%(+8.5 分)。在匹配的 5% 事件级误报目标下,动作调节将及时召回率提高到 77.9%,而仅观察控制为 48.6%,动作洗牌控制为 37.9%。这些模拟结果支持动作条件验证,作为在分块执行期间恢复反馈的一种方式,同时保持修复与推理延迟一致。