论文

HIPIF:长程LLM智能体学习的分层规划与信息折叠

HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning

模型训练强化学习Agentic RL

摘要

虽然大型语言模型(LLM)在广泛的任务中展示了作为自主代理的强大能力,但它们的性能在多回合长视野代理任务中通常会下降。现有方法通过细粒度的信用分配来缓解长期稀疏奖励和分层强化学习来分解任务并减少长期依赖,取得了进展。然而,这些方法仍然没有直接解决长上下文干扰,其中不断增长的历史削弱了智能体跟踪全局任务状态的能力,并损害了后续的推理和决策。受到人类通过子目标分解和完成进度总结来处理复杂任务的方式的启发,我们提出了用于长期 LLM 代理学习的层次规划和信息折叠(HIPIF)。 HIPIF 端到端地训练智能体围绕显式子目标组织长期执行,同时折叠已完成的子目标历史以减少长期上下文干扰。此外,为了稳定基于子目标的规划和执行,HIPIF结合了分层反射和面向子目标的过程奖励来指导子目标的生成、转换和执行,而不依赖于昂贵的辅助模型或特定于任务的专家轨迹。对三个公开可用的代理基准的广泛实验证明了我们方法的有效性。

HIPIF:长程LLM智能体学习的分层规划与信息折叠:论文配图
图 1:HIPIF 设计概述。 (a):分层规划和信息折叠的端到端培训。 (b):层次反思。 (c):以子目标为导向的过程奖励。