论文
用于复杂序贯决策任务的混合LLM增强强化学习Agent
Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks
摘要
大语言模型(LLMs)在最近展示了强大的推理、规划和工具使用能力,使新的自主代理形式化为可能。然而,基于LLM的代理在需要精确动作优化和环境交互的长短期决策任务中挣扎。强化学习(RL),虽然适用于序列控制,但在处理复杂场景所需的高级抽象和任务分解能力方面往往缺乏。本文介绍了一个集成LLM驱动规划与RL驱动动作优化的强化学习代理。提出的架构利用LLM生成子目标、结构化计划和上下文指导,而RL代理通过与环境的交互来细化底层动作。在序列决策任务上的实验表明,该方法比仅使用RL或仅使用LLM的基准具有更好的样本效率、更高的成功率和更连贯的动作轨迹。这种混合范式突显了构建更具能力自主系统的有希望的方向。