论文

SynthDemo-RL:通过大语言模型指导的综合演示打破 VLA 适应中的零奖励障碍

SynthDemo-RL: Breaking the Zero-Reward Barrier in VLA Adaptation with LLM-Guided Synthetic Demonstrations

模型训练合成数据

摘要

微调视觉-语言-动作(VLA)模型通常依赖于人类远程操作演示,而当成功的轨迹很少被采样时,具有稀疏二元奖励的强化学习(RL)面临着探索挑战。我们提出了 SynthDemo-RL,这是一个师生框架,其中自动化教师将模拟器特权状态转换为成功的操作轨迹,通过监督微调(SFT)从中提取 VLA 学生,并使用具有二元任务成功奖励的 PPO 来完善学生。我们研究奖励覆盖率,即在固定评估协议下至少观察到一次成功的任务比例,作为平均成功率的补充。在 LIBERO-PRO(未进行演示的受干扰 LIBERO 任务的公共基准)上,对于在原始 LIBERO 任务上微调的 pi_0.5 策略,57 个评分任务中有 27 个的成功率恰好为 0%。来自该策略的直接 PPO,在与 SynthDemo-RL 的细化阶段相同的 PPO 配方和相同的 RL 计算下,挽救了这 27 项任务中的 10 项,并将 17 项保留为 0%。 SynthDemo-RL 每个任务有 50 个合成轨迹,并且没有新的人类演示,成功拯救了全部 27 个轨迹,并且在 LIBERO-PRO 的位置​​轴和任务轴上分别达到了 97.8% 和 97.1% 的平均成功率。在标准 LIBERO 上,相同的流程在没有人类演示的情况下达到 96.0%,在每项任务 50 次人类演示训练的 pi_0.5 的范围内 1.7 个点。我们进一步验证 RoboTwin 2.0 上的管道,并验证在 MuJoCo 双胞胎中训练的策略的轨迹在物理机器人上执行开环。