论文

DRIVE:以任务成功为条件的机器人轨迹多样性奖励

Many Ways to Succeed: Diversity-Driven RL Fine-Tuning for VLA Generalization

模型训练应用与实践强化学习奖励建模与过程监督机器人

摘要

强化学习(RL)微调通过闭环经验改进了视觉-语言-动作(VLA)策略,但超出微调分布的泛化能力仍然有限。我们的分析揭示了对探索的选择性重塑:强化学习在全球范围内收缩行为,但使成功轨迹多样化,以更少的部署获得成功,并且比监督微调覆盖更多的潜在任务有效解决方案空间。更广泛的成功模式覆盖范围可能会在分销转移下提供替代策略。受此启发,我们引入了 DRIVE(多样性驱动的 RL 微调 VLA 通用化),它将成功行为的多样性转变为明确的 RL 目标。 DRIVE 组在匹配的任务条件下推出,将其轨迹与时间对齐进行比较,并从相对行为多样性中获得成功条件的内在奖励。这种设计鼓励更广泛地覆盖可行的解决方案,而不奖励各种失败或表面的时间差异。在 LIBERO-Plus、ManiSkill3 和 RoboTwin 2.0 中,DRIVE 得到改善 与普通 RL 微调相比,平均域外 (OOD) 性能在 $π_0$ 上提高了 5.3 点,在 $π_{0.5}$ 上提高了 2.0 点。在双臂 AgileX PiPER-X 平台上,DRIVE 将平均 OOD 成功率从 64.1% 进一步提高到 73.3%(+9.2 点),展示了在物理部署下持续存在的收益。

DRIVE:以任务成功为条件的机器人轨迹多样性奖励:论文原图
图 3:DRIVE 概述。 (a) 推出被编码为每决策特征轨迹。 (b) GAK 通过在单调时间路径上软对齐特征序列来计算行为相似性,处理执行率不匹配。 (c) 成对相似性转化为成功条件多样性奖励,并添加到环境奖励中以促进探索多样性。