论文

剖析优势引导的视觉-语言-行动政策后训练

Dissecting Advantage-Guided Post-Training for Vision-Language-Action Policies

模型训练强化学习

摘要

优势引导强化学习提供了一种使用有限的机器人数据对视觉语言动作(VLA)策略进行后训练的实用方法。然而,它的表现取决于几个耦合的选择,包括如何构建、校准和使用批评家衍生的优势来进行政策训练。现有的配方通常将这些选择组合成一个端到端的过程,使得它们各自的效果难以识别。在这项工作中,我们通过一项受控实证研究剖析了优势引导的 VLA 训练后,该研究将这些设计选择分开,同时考虑到它们不同的估计值。我们开发特定阶段的离线评估方法来有效地筛选替代选择,而不需要对每种可能的组合进行广泛的真实机器人策略评估。分阶段评估确定了一个模块化方案,该方案结合了时间差异优势构建、分组校准和连续优势加权。在四个现实世界的双手任务中,所得到的方案比 SFT 初始化的平均任务进度和成功率分别提高了 0.42 和 0.63。此外,所提出的评估诊断显示出与下游现实世界表现的总体一致性,支持它们用于解释经验结果并在实践中选择优势引导的后训练设计。