论文
稀疏情节结果中 VLA 的在线 RL 微调 的分层优势权重
Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes
摘要
当通过在线强化学习对预训练的 VLA 策略进行微调时,每个采样回合仅产生一个二进制结果(成功或失败),但策略更新需要每次转换监督。现有方法通常将这种稀疏结果减少为单个标量奖励或优势信号,这会合并不同形式的过渡级反馈,并在基本任务成功实现后提供有限的指导。首先,单个标量信号将生存能力和效率这两个目标混为一谈;一旦实现基本成功,二进制标签就不会提供梯度来区分高效完成和缓慢完成。其次,真实环境的执行轨迹混合了自主和干预部分;天真地跨这些边界分配事件结果会导致不正确的贡献分配。为了解决这些问题,我们提出了分层优势加权行为克隆(HABC),它在不同的数据子集上为这两个目标训练单独的批评者头,并将其输出与状态自适应平衡相结合。状态自适应门 $g_t$ 合并了它们的一步优势,在成功不确定时优先考虑可行性,仅在可行性较高时才转向效率,并将结果转换为策略损失的每次状态转移的权重。干预感知贡献分配进一步将结果标签限制在当前策略执行的部分,从而防止监督跨干预边界泄漏。在针对三项接触丰富的双手任务的真实机器人实验中,HABC 将监督 微调 (SFT) 基线的 36%、44% 和 12% 提高到 92%、88% 和 38%。