论文
WorldSample:具有世界建模的闭环真实机器人强化学习
WorldSample: Closed-loop Real-robot RL with World Modelling
摘要
强化学习 (RL) 可以克服模仿学习 (IL) 的演示覆盖范围限制,允许机器人通过试错交互进行改进,超越演示中观察到的状态。然而,在真实机器人上部署强化学习仍然受到高交互成本的限制,因为每次真实机器人执行轨迹成本高昂,并且仅反映一种已实现的行动结果路径。为了应对这一挑战,我们提出了 WorldSample,这是一种用于真实机器人 RL 的基于物理的数据增强框架,它关闭了真实机器人执行轨迹、世界模型生成和策略改进之间的真实合成循环。 WorldSample 以真实执行轨迹为基础,通过训练后的世界模型生成高保真合成过渡,从而大大降低视觉幻觉。具体来说,WorldSample 不是简单地将这些转变用作现实世界的经验,而是引入了策略节奏学习 (PPL),通过样本选择和调度来调节训练过程,平衡有用的增强与价值高估,并减轻幻觉引起的噪音。对涉及丰富接触和精确任务的机器人操作任务的实验表明,与基线相比,WorldSample 将策略成功率提高了 28%,同时减少了 59% 的训练步骤。此外,与仅演示的 后训练 相比,WorldSample 将世界模型视觉保真度在 PSNR 中提高了 19.4dB,在 SSIM 中提高了 0.47,验证了真实合成环路对策略和世界模型性能的有效性。