论文

用于愿景-语言-行动政策改进的潜在引导流匹配

Potential-Guided Flow Matching for Vision-Language-Action Policy Improvement

模型训练强化学习

摘要

大型视觉语言动作(VLA)策略越来越多地被训练为动作块的条件生成模型。然而,部署会产生质量参差不齐的体验——成功的演示、部分完成、可恢复的错误和失败——这很难通过标准模仿来使用。全行为克隆(BC)模仿失败,过滤后的BC丢弃有用的子轨迹,离线强化学习又增加了一大批评。我们引入了 ForesightFlow,这是一种自引导的流程匹配策略,它通过学习的成功潜力轨迹来增强每个生成的动作块。相同的流程提出候选操作并对其进行评分,从而在没有外部批评者的情况下实现最佳 $K$ 推理。关键问题是政策改进和价值校准需要不同的监督:优势权重应该强调高质量的行动,但对潜在坐标应用相同的权重会抑制失败梯度并产生过度自信的分数。我们通过解耦优势加权流匹配来解决这个问题,仅将指数优势权重应用于动作速度,同时统一训练潜在速度。我们进一步推导了一种用于条件流匹配的一步边界估计器,允许通过单个停止梯度前向传递进行优势计算。在五个 BEHAVIOR-1K 模拟任务和五个现实世界的双手任务中,ForesightFlow 改进了模仿基线,匹配模拟成功中最强的单独批评者基线,提高了现实世界的成功率,并将训练计算量减少了 38%\%$。消融表明,解耦可以防止价值幻觉,一步估计器可以保留候选排名的保真度,而自引导采样可以提高长期执行力。