论文
SmoothRL:异步执行期间的在线强化学习
SmoothRL: Online Reinforcement Learning During Asynchronous Execution
摘要
在物理世界中部署机器人策略需要满足两个基本需求:可靠性和流畅的实时执行。然而,部署最先进的通才模型在两个方面都面临着挑战。要实现实际部署所需的精度和稳健性,需要样本高效的在线强化学习 (RL) 来适应预训练模型。同时,机器人基础模型规模的不断扩大导致推理延迟更高。为了满足高延迟下的实时约束,现代系统采用带有动作分块的异步推理,将策略计算与块执行重叠,以隐藏延迟并实现平滑控制。尽管它们具有互补的作用,但将异步执行与基于梯度的在线强化学习相集成仍然没有得到充分探索。我们提出了 SmoothRL,这是一个在线 RL 框架,可以在异步推理循环中微调预训练策略。 SmoothRL 遵循价值梯度范式,使用相对于政策行动的行动价值函数的梯度直接更新政策参数。为了在异步执行下实现正确的优化,SmoothRL 在训练期间显式建模异步推理过程。具体来说,每个生成的动作块按帧索引分为三个区域: 提交区域,由前一个推理周期提交的动作组成;执行区域,包含机器人执行的新生成的动作;以及一个被丢弃的区域,包含被下一个推理周期取代的动作。梯度仅通过执行区域传播,确保策略优化与异步执行引起的轨迹分布保持一致。我们在需要高精度的现实机器人任务以及需要异步执行的高动态任务上评估 SmoothRL。