论文
StructRL:基于流的 VLA 的结构化动作空间探索
StructRL: Structured Action-Space Exploration for Flow-Based VLAs
摘要
基于流的视觉-语言-动作(VLA)模型现在广泛用于连续机器人操作,而在线强化学习(RL)正在成为使其适应新任务的关键技术。现有的强化学习方法通常通过各向同性或时间独立的噪声在去噪链内注入随机性。然而,有效的机器人探索需要结构化噪声:时间上平滑并且跨动作组的缩放不同。我们证明,简单地将链内噪声切换为结构化形式是不够的:在执行之前剩余的去噪步骤可以削弱在中间流动时间添加的噪声,我们将这种现象称为\emph{结构化噪声稀释}。我们提出 \textbf{StructRL},它通过三个耦合选择将策略随机性重新定位到动作空间来避免稀释:(i)确定性 ODE 解码器,(ii)直接注入动作空间中的结构化噪声,以及(iii)最后一步重播,其中策略梯度更新避免将可能性分配给中间去噪状态。这使得结构化探索与执行的动作联系在一起,同时为流解码器提供易于处理的训练信号。在多个模拟操作基准和两个实际任务上的三个基于流的 VLA 模型中,StructRL 比之前的链内基线提高了探索效率和 OOD 性能,证明了结构化动作空间探索对于将基于流的 VLA 与 RL 相适应的有效性。 \textbf{项目页面:} https://flyfaerss.github.io/structrl/