论文
想象恢复:视觉-语言-动作模型的推理时间反事实调整
Imagining Recovery: Inference-Time Counterfactual Realignment for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型提高了机器人操作的灵活性和通用性,但它们仍然容易受到在线干扰的影响,例如任务目标、场景配置或机器人状态的变化。现有的恢复方法通常需要故障数据、策略重新训练或外部纠正代理,从而引入额外的数据要求和执行风险。我们提出了 Counterfactual Realignment (CoRe),这是一种 无需训练 框架,可以在推理时恢复冻结的 VLA,而无需故障数据。在检测到偏差后,CoRe 会使用综合观察代替物理执行,想象策略如何从最近的可行状态继续实现当前目标,然后最小限度地重新调整机器人和场景,以重新加入这个想象的延续,然后再将控制权返回给策略。因此,恢复计划无需物理试错,保留已完成的任务进度,并以统一的方式处理中间的指令更改和物理扰动。跨多个模拟器、VLA 主干和现实世界设置的大量实验表明,CoRe 将成功率提高了 85.0 个百分点,达到接近标称水平,同时将物理修复减少了 42.2%,无需策略 微调 或特定于故障的恢复训练。