论文

LaGO:在线强化学习的潜在动作引导

LaGO: Latent Action Guidance for Online Reinforcement Learning

模型训练强化学习

摘要

大语言模型(LLM)已展现规划与序列决策的强大潜力——但先前工作常把它们用作直接控制器——这要求精确动作生成——实践中可能不可靠。本文提出面向在线强化学习的潜在动作引导(LaGO)——框架:把预训练LLM用作潜在动作先验——软性引导在线策略优化——而非把LLM当作显式规划器或控制器。在离散控制基准CLEVR-Robot与连续控制基准Meta-World上的实验表明LaGO较原始PPO持续改进奖励与成功率。特别是——LaGO把CLEVR-Robot平均成功率从15.1%提升到27.2%——Meta-World从2.7%提升到15.2%。我们的分析进一步显示更强的预训练LLM提供更有效引导——提示LLM知识能改进规划与在线决策。

LaGO:在线强化学习的潜在动作引导:论文配图
图 1:LaGO 框架概述。数值环境状态通过学习投影层注入到冻结的 LLM 潜在空间中,所得的动作分布用作在线 RL 策略优化的 KL 正则化先验。