论文
ReCoVLA:视觉-语言-行动策略中失败恢复的 VLM 引导奖励编译
ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies
摘要
视觉-语言-行动(VLA)政策为语言条件操纵提供了强大的先验,但在需要有针对性的恢复的非名义状态下仍然脆弱。我们提出了 ReCoVLA——一种故障条件剩余恢复框架,它使预训练的 VLA 策略保持冻结,使用外部视觉语言模型(VLM)来推断故障模式和恢复阶段,并从任务相关组件中编译出结构化奖励。 ReCoVLA 没有使用 VLM 直接生成操作或奖励,而是将其用作语义奖励选择器:它预测模拟剩余策略训练的恢复描述符和奖励掩码,然后对经过训练的恢复策略进行零样本模拟到实际部署。这将高级故障理解与底层纠正控制分离,以支持不同的 VLA。短视野、长视野和接触丰富的操作任务的实验表明,ReCoVLA 的平均表现优于测试的基线。在模拟中,我们的奖励编译器将微调 $π_{0.5}$ 基线的平均成功率从 36.7% 提高到 66.7%。在物理零样本模拟真实实验中,ReCoVLA 取得了最佳平均性能,成功率为 61.7%。