论文
面向LLM智能体的带增强步级转移的分层强化学习
Hierarchical Reinforcement Learning with Augmented Step-Level Transitions for LLM Agents
摘要
大语言模型(LLM)智能体已在复杂交互式决策任务中展现出强大能力。然而,现有LLM智能体通常依赖越来越长的交互历史,导致计算成本高、可扩展性受限。本文提出STEP-HRL,一个分层强化学习(HRL)框架,仅以单步转移而非完整交互历史为条件,实现步级学习。STEP-HRL对任务进行分层结构化,用已完成的子任务表示整体任务的全局进度。通过引入局部进度模块,它还在每个子任务内迭代且选择性地总结交互历史,生成紧凑的局部进度摘要。这些组件共同为高层与低层策略生成增强的步级转移。在ScienceWorld和ALFWorld基准上的实验结果一致表明,STEP-HRL在性能与泛化上大幅超越基线,同时降低token用量。我们的代码见 https://github.com/TonyStark042/STEP-HRL。
