论文

RL 词元:使用视觉-语言-动作模型引导在线强化学习

RL Token: Bootstrapping Online RL with Vision-Language-Action Models

模型训练强化学习

摘要

视觉-语言-动作 (VLA) 模型可以学习“开箱即用”执行各种操作技能,但要实现现实世界任务所需的精度和速度,还需要进一步的 微调——例如,通过强化学习 (RL)。我们引入了一种轻量级方法,只需几个小时的实际实践即可实现预训练 VLA 的样本高效在线 RL 微调。我们 (1) 调整 VLA 以公开“RL 词元”,这是一种紧凑的读出表示形式,可保留与任务相关的预训练知识,同时充当在线 RL 的有效接口,以及 (2) 在该 RL 词元上训练一个小型策略—价值评估头以改进操作,同时将学习到的策略锚定到 VLA。使用 RL 词元 (RLT) 的在线 RL 可以快速有效地使用 RL 微调大型 VLA。在四项真实机器人任务(螺丝安装、扎带紧固、充电器插入和以太网插入)中,RLT 将任务最困难部分的速度提高了 3 倍,并在几分钟到几个小时的练习内显着提高了成功率。它甚至可以在某些任务上超越人类远程操作的速度。