论文
了解结果的分歧之处:通过概率块屏蔽实现高效的 VLA RL
Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking
摘要
强化学习 (RL) 允许视觉-语言-动作 (VLA) 策略通过直接优化任务成功来超越其训练分布,但 后训练 的计算成本很高。自然的反应是通过更快的模拟器和世界模型来加速收集。在基于 GRPO 的 VLA RL 中,我们发现主要成本在其他地方:梯度计算约占我们运行中每步挂钟时间的 78%,而 rollout 收集仅占 21%。梯度成本占主导地位,因为大部分计算都花在对学习贡献不大的阶段。 GRPO 的学习信号由优势方差驱动:只有成功和失败的采样轨迹出现分歧的阶段才会产生学习信号。然而,GRPO 为部署中的每个块分配相同的优势。因此,参与者更新计算在整个轨迹上统一花费,包括在 预训练 和受监督的 微调 之后策略已经处理的阶段。本文提出了概率块掩蔽(PCM),这是对 GRPO 的一种直接修改,它将梯度计算分配给每个轨迹中概率选择的小块子集。 PCM 使用成功-失败动作方差(每阶段梯度方差的采样轨迹衍生代理)对语义阶段进行评分,并使用在线更新的阶段级保持概率对固定块预算进行采样。我们将每阶段梯度方差形式化,因为数量决定了梯度计算在哪里有用,并表明成功-失败动作方差为其提供了可测量的代理。 PCM 不需要奖励模型或博学的批评家。在三个 LIBERO 基准测试中,PCM 与标准 GRPO 的最终成功率相匹配,同时实现了 2.38 倍的挂钟加速、4.8 倍的梯度更新速度和 60% 的峰值激活内存降低,同时反向传播的轨迹块少于 20%。