论文
RePO-VLA:视觉-语言-行动模型的恢复驱动策略优化
RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models
摘要
视觉-语言-行动 (VLA) 模型在长期、接触丰富的操作中仍然很脆弱,因为仅成功的模仿对执行漂移几乎没有监督,而失败的推广通常会被丢弃。我们引入了 RePO-VLA,这是一个恢复驱动的策略优化框架,它为成功、恢复和失败轨迹分配不同的角色。 RePO-VLA 首先应用恢复感知初始化 (RAI)、切片恢复段并重置历史记录,因此纠正措施取决于当前的不良状态而不是之前的故障。然后,它学习进度感知语义值函数(PAS-VF),将时空轨迹特征与指令和成功参考对齐。由此产生的标签通过可靠性衰减来挽救有用的故障前缀,而低价值标签则标记漂移和终端故障,教导标称、失败和纠正措施之间的差异。数据引擎将不利状态转化为计划者生成或人工收集的纠正措施,教导恢复到成功的方向。价值条件细化 (VCR) 训练策略偏向于高进度行动。在部署时,固定的高值 ($v=1.0$) 会偏向学习到的成功流形,而无需在线故障检测器或启发式重试。我们引入了 FRBench,它具有标准化的错误注入和以恢复为中心的评估。在模拟和现实世界的双手任务中,RePO-VLA 提高了鲁棒性,将对抗成功率从平均 20% 提高到 75%,在规模化的现实世界试验中提高到 80%。