论文

面向LLM智能体的带增强步级转移的分层强化学习

Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents

模型训练上下文与知识强化学习上下文工程Agentic RL

摘要

大语言模型(LLM)智能体已在复杂交互式决策任务中展现出强大能力。然而,现有LLM智能体通常依赖越来越长的交互历史,导致计算成本高、可扩展性受限。本文提出STEP-HRL,一个分层强化学习(HRL)框架,仅以单步转移而非完整交互历史为条件,实现步级学习。STEP-HRL对任务进行分层结构化,用已完成的子任务表示整体任务的全局进度。通过引入局部进度模块,它还在每个子任务内迭代且选择性地总结交互历史,生成紧凑的局部进度摘要。这些组件共同为高层与低层策略生成增强的步级转移。在ScienceWorld和ALFWorld基准上的实验结果一致表明,STEP-HRL在性能与泛化上大幅超越基线,同时降低token用量。我们的代码见 https://github.com/TonyStark042/STEP-HRL。

面向LLM智能体的带增强步级转移的分层强化学习:论文配图
图 1:(a):STEP-HRL 的流程。本地进度策略负责生成每个子任务中本地交互历史的紧凑摘要。具体来说,本地进度策略 πθp\pi^{p}_{\theta} 取决于先前进度 pt−1kp^{k}_{t-1}、当前子任务 gkg_{k}、在−1ka^{k}_{t-1} 执行的操作以及生成更新的本地进度 ptkp^{k}_{t} 所得到的观察结果 otko^{k}_{t}。低级策略 πθl\pi^{l}_{\theta} 将 ptkp^{k}_{t} 与观察 otko^{k}_{t} 和子任务 gkg_{k} 相结合以生成原始动作。当当前子任务 gkg_{k} 终止时,其最终本地进度 p^k\hat{p}_{k} 被转发到高级策略 πθh\pi^{h}_{\theta}。以任务指令 cic_{i}、已完成的子任务 GkG_{k}、最终局部进度 p^k\hat{p}_{k} 和下一个子任务的初始观察 o0k+1o^{k+1}_{0} 为条件,πθh\pi^{h}_{\theta} 生成后续子任务。 (b):我们模型的结构。三种不同的策略共享相同的参数,但分别配备不同的批评者网络进行离线强化学习训练。