论文
eRLT:通过与操作相关的词元路由进行高效的 VLA 强化学习
eRLT: Efficient VLA Reinforcement Learning via Action-Relevant Token Routing
摘要
视觉-语言-动作(VLA)模型为机器人操作提供了强大的行为先验,但有效地使其适应下游任务仍然具有挑战性。最近的工作通过在线强化学习(RL)调整冻结的 VLA 来解决这一挑战,其样本效率取决于参与者和批评者使用的状态表示的质量。现有方法使用独立于 VLA 的视觉编码器或通过内部 VLA 表示的固定压缩来构造此类表示。这两种设计都没有明确提取对下游动作细化和动作值估计最有用的特定于任务的动作相关的 VLA 特征,因此限制了样本效率。为了解决这个限制,我们引入了 eRLT,它通过跨词元和冻结 VLA 层路由特定于任务的操作相关信息来构建有效的状态表示。具体来说,学习的路由词元在多个深度上动态聚合视觉语言特征,而轻量级层路由器将这些摘要组合成固定维度的 RL 词元。路由模块使用专家演示来初始化,以捕获专家操作的预测特征,然后使用来自在线交互的评论家反馈进行细化,以进行操作价值估计。在七项 LIBERO 和 RoboTwin 任务中,eRLT 将平均归一化学习曲线 AUC 比代表性基线提高了 23.7%。 USB 连接器插入和主板带状电缆插入的真实机器人实验进一步表明,与最强基线相比,AUC 分别提高了 108.9% 和 46.7%。