论文

通过异步重放锚定策略改进实现稳定高效的真实世界在线 VLA 后训练

Stable and Efficient Real-World Online VLA Post-Training via Asynchronous Replay-Anchored Policy Improvement

模型训练强化学习

摘要

视觉-语言-动作(VLA)模型的在线后训练需要有效利用机器人交互,并根据不断收集的经验进行可靠的策略改进。我们提出了异步重播锚定策略改进(RAPolicy),这是一个同时执行轨迹采样和学习的框架,同时将批评者和参与者更新都基于重播行为。评论家从记录的动作中学习块级值,并构建贝尔曼目标,而无需预测下一步动作,从而减少计算和对重放覆盖范围之外的动作值估计的依赖。一步流程参与者重用部署期间存储的初始噪声,并通过优势加权条件似然进行学习,直接监督用于执行的动作映射。我们在现实世界中通过四种单任务设置和一种联合五任务设置来评估 RAPolicy,在线训练预算仅为 1--2 小时。从每个任务仅进行 10 次演示的策略微调开始,RAPolicy 迅速适应新的单一任务,并实现了平均 86.3% 的成功率。在联合多任务设置中,RAPolicy 将总体成功率从 52% 提高到 88%,同时保持已经可靠的任务的性能并改进较弱的能力。总体而言,RAPolicy 在总体任务成功方面远远优于基线,同时需要较少的人工干预,表现出稳定的政策改进和较高的在线训练效率。项目页面:此 https URL。