不确定性门控探索噪声抑制在线强化学习流程匹配视觉-语言-动作策略微调中的任务崩溃
Uncertainty-Gated Exploration Noise Suppresses Task Collapse in Online RL Fine-Tuning of a Flow-Matching Vision-Language-Action Policy
摘要
对预训练的流程匹配视觉语言动作(VLA)策略进行在线强化学习微调,可以让机器人在部署后继续学习,但持续的更新往往会破坏单个任务的能力,而总体看起来仍然很健康。我们在 LIBERO-10 上匹配的小型计算预算下研究了这种故障模式(我们称之为任务崩溃),并采用由 PPO 随机 (SDE) 采样训练的 4.5 亿参数 SmolVLA 策略。三种探索噪声策略在一个实时变量上有所不同:固定噪声尺度、ReinFlow 风格的学习噪声网络以及不确定性门控控制器,该控制器根据与任务无关的新颖性和能力信号在任务流中重新分配探索,而无需任务标签或情节边界。根据合并定义,固定噪声会崩溃三个种子中的两个任务,并在迭代 200 时测量每个种子中的学习噪声,而控制器不会崩溃其三个种子中的任何一个种子。测量的参数位移表明控制器的动作专家不断变化,而其平均施加噪声接近可用日志中的固定范围。匹配比较支持控制器对任务保存的影响;随着时间的推移,其在各个州的适应的单独贡献并没有被消除。较低的固定规模会减缓下降速度,但并不能阻止下降。在此预算中,没有任何手臂能够改善行为克隆基线。除了这个结果之外,还测量了该机制的两个属性,而不是作为其原因提供:遵循参考配方,在没有 fp32 主副本的 bfloat16 中运行训练,在这种情况下,96.02% 的动作专家元素在三个连续迭代中保持位相同,并且参考学习率下的 fp32 主副本在单种子观察中折叠双臂。我们发布了根据四种定义测量每个任务崩溃的工具,重新评分噪声和仪器皮重。