论文

HiL-ResRL:通过人机循环残差强化学习实现与模型无关的微调适配器

HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning

模型训练强化学习

摘要

生成模仿学习的最新进展极大地推动了机器人操作领域的发展。然而,大多数现有模型严重依赖行为克隆(BC),这种范式存在复合错误和分布转移的问题。因此,这些模型在实际工业部署中的功效仍然有限。为了应对这些挑战,我们引入了一种新颖的即插即用 微调 管道,旨在促进视觉-语言-动作 (VLA) 模型在现实环境中的稳健部署。与当代强化学习 (RL) 微调 策略(通常受到特定模型架构的限制)相比,我们提出的框架与模型无关,并且适用于各种 VLA 模型。我们将 VLA 生成的操作概念化为一个统一的接口,在此基础上我们训练剩余策略。该政策旨在纠正次优行为并解决模仿学习中固有的分配变化。此外,我们还采用人机交互指导,以确保安全探索并最大限度地提高训练效率。我们直接在现实世界的机器人环境中进行实验。结果表明,在真实世界的在线 RL 训练仅 1.5 小时内,真实机器人的平均成功率就超过 95%。我们的工作提出了在工业场景中部署行为克隆模型的实用解决方案。