论文

RedFlow:将故障重定向到流匹配 VLA 策略的操作级更正

RedFlow: Redirect Failure into Action-level Corrections for Flow-matching VLA Policy

模型训练强化学习

摘要

强化学习 (RL) 可以根据部署经验改进视觉-语言-操作 (VLA) 策略,但基于奖励和偏好的 RL 主要识别所需的行为,而不指定如何纠正失败的操作、未充分利用故障轨迹并限制样本效率。这种修正可以从固定的执行轨迹中得出吗?我们的主要见解是,具有不同结果的执行轨迹可能包含在相似状态下执行的操作块,从而使更高质量的块能够提供本地支持的纠正参考。基于这一见解,我们引入了 \textbf{RedFlow},一种用于流匹配 VLA 策略的离线 后训练 方法。 \emph{执行上下文匹配}使用估计任务进度和机器人本体感觉的紧凑表示来对块进行分组。 \emph{质量引导动作重定向}分配签名的块质量分数并将较高质量的块聚合到纠正目标中,增强高质量块,抑制低质量块,并将可纠正块重定向到其目标。 RedFlow 在 后训练 期间既不需要外部 HIL 校正,也不需要在线数据收集。在四个 LIBERO 套件中,RedFlow 将平均成功率从 56.2% 提高到 68.2%,比最强的评估离线基线 AWR (62.3%) 提高了 5.9 个百分点。在三个真实机器人任务中,它将平均成功率从 56.7% 提高到 74.7%。在 LIBERO-Spatial 上,RedFlow 通过 1{,}536 次固定部署达到 75.8% 的成功率,而评估的在线方法需要 8.7--16$\times$ 的新 后训练 部署才能达到相同的阈值。