论文
DEFLECT:延迟鲁棒异步 VLA 的时间反事实偏好学习
DEFLECT: Temporal Counterfactual Preference Learning for Delay-Robust Asynchronous VLAs
摘要
视觉-语言-动作 (VLA) 策略越来越依赖异步推理来隐藏正在进行的机器人运动背后的大模型延迟。虽然这避免了同步动作块执行的走走停停的行为,但它会造成预测执行不匹配:下一个块是根据推理开始时的陈旧观察计算出来的,但仅在机器人和场景演化后才执行。因此,适合预测时间状态的操作可能会与执行时间状态不一致。现有的运行时修复、行为克隆和偏好对齐方法不会直接教导策略来解决这种陈旧输入不匹配的问题。我们提出 DEFLECT,一个用于延迟鲁棒异步 VLA 的离线 后训练 框架。 DEFLECT 将延迟引起的不匹配转换为反事实偏好监督:冻结的参考 VLA 从未来的执行时间观察中生成首选块,并从过时的预测时间观察中生成拒绝的块。可训练策略在相同的部署时间输入下对两个块进行评分,学习支持与执行时间一致的操作,同时受监督的 微调 锚保留专家操作流形。 DEFLECT 不需要人类偏好标签、奖励模型、在线机器人部署、架构更改或额外的推理时间计算。在 Kinetix、LIBERO 和三个真实机器人任务中,DEFLECT 提高了强异步 VLA 基线上的延迟鲁棒性,将高延迟成功率提高了 6.4 个百分点,并在真实规模 VLA 上的最长延迟下实现了 4.6 个百分点的增益。