论文
LaGO:在线强化学习的潜在动作引导
LaGO: Latent Action Guidance for Online Reinforcement Learning
摘要
大语言模型(LLM)已展现规划与序列决策的强大潜力——但先前工作常把它们用作直接控制器——这要求精确动作生成——实践中可能不可靠。本文提出面向在线强化学习的潜在动作引导(LaGO)——框架:把预训练LLM用作潜在动作先验——软性引导在线策略优化——而非把LLM当作显式规划器或控制器。在离散控制基准CLEVR-Robot与连续控制基准Meta-World上的实验表明LaGO较原始PPO持续改进奖励与成功率。特别是——LaGO把CLEVR-Robot平均成功率从15.1%提升到27.2%——Meta-World从2.7%提升到15.2%。我们的分析进一步显示更强的预训练LLM提供更有效引导——提示LLM知识能改进规划与在线决策。
