论文

SQAM:用标量伴随近似微调流动作策略

Q-Learning with Scalar Adjoint Matching

模型训练应用与实践强化学习奖励建模与过程监督机器人

摘要

流策略捕获丰富多样的动作分布,并使用离策略强化学习对其进行微调以改进演示,这引起了越来越多的兴趣。然而,针对学习的价值函数微调流策略并非易事,因为该策略会在许多流步骤上生成其操作。伴随匹配提供了一种原则性的方法,通过将价值信息从最终动作传播回每个流程步骤来更新流程模型本身,但它需要一个向量——每个步骤通过策略的雅可比乘积,其成本随着流程步骤的数量和策略大小而增长。我们观察到预训练流策略的批量平均速度雅可比矩阵集中在其对角线上。受这一发现的启发,我们推导了一个封闭形式的标量伴随,它通过流动时间来缩放最终动作的值梯度,从而消除了每步向量——雅可比积。我们进一步发现,在标量伴随下,控制Critic对策略生成行为的价值尤为重要。基于这些发现,我们提出了标量 Q 学习 伴随匹配(SQAM),它将标量伴随与这些动作的值惩罚相结合。 SQAM 的收益集中在四个最难的 OGBench 领域,其成功率比每个领域中最强基线的成功率高出 18 至 35 个百分点。为了测试 SQAM 是否扩展到大型预训练策略,我们还在真正的双手机器人上微调了视觉-语言-动作策略。 SQAM 改进了所有三项任务的监督微调。

SQAM:用标量伴随近似微调流动作策略:论文原图
图 8:三个现实世界操作任务的概述。从上到下:翻转塑料袋,将吸管放入杯子中,将水果放入锅中并盖上盖子。每行从左到右说明任务进展。