论文

通过自监督轨迹分布优化实现流量匹配 VLA 策略的在线进化策略

Online Evolution Strategy for Flow-Matching VLA Policies via Self-Supervised Trajectory Distribution Optimization

模型训练强化学习

摘要

基于生成框架(例如流程匹配)的视觉-语言-动作(VLA)模型最近在机器人操作方面取得了令人印象深刻的性能。与确定性策略不同,流匹配使 VLA 模型能够学习条件动作轨迹分布,其中潜在噪声向量在同一任务场景下引发不同的动作。然而,我们观察到这些分布通常是不正确的,成功和失败的行为同时存在,而相当大的概率质量仍然存在于不利的区域。为此,我们提出了Online-ES,一种基于进化策略(ES)的流匹配VLA在线适应框架,它通过交互反馈细化学习到的动作轨迹分布。我们的方法没有修剪潜在噪声空间,而是直接在动作轨迹空间中进行进化探索,其中由流匹配生成的不同轨迹为适应提供了候选解决方案。通过扰动采样轨迹并评估其执行结果,我们得出了一个自监督 MSE 目标,该目标将演化方向从轨迹空间转移到模型参数空间。在数学上,我们证明所提出的目标提供了最佳进化方向的无偏估计。此外,我们还将失败经验作为负反馈纳入,以规范演化方向,引导策略远离先前探索的失败区域。模拟和现实环境中的实验表明,Online-ES 无需学习价值模型或计算优势即可实现与强化微调相当的策略改进。