论文

HiMAC:面向长时程LLM智能体的宏-微分层学习

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents

模型训练强化学习Agentic RL

摘要

大语言模型(LLM)智能体近来在交互式决策中展现出强大能力,但在需要结构化规划与可靠执行的长时程任务上仍存在根本局限。现有方法主要依赖扁平的自回归策略,高层推理与低层动作在单一token序列中生成,导致低效探索和长轨迹上的严重错误传播。在这项工作中,我们提出HiMAC,一个分层智能体式RL框架,把长时程决策显式分解为宏观规划与微观执行。HiMAC把推理建模为结构化蓝图生成过程,随后进行目标条件动作执行,使基于LLM的智能体实现稳健的长时程规划。为高效训练这一层次结构,我们引入无评论者的分层策略优化范式,通过分层相对优势估计把基于群组的强化学习扩展到双层结构。此外,我们提出迭代协同演化训练策略,在规划器探索与执行器适应之间交替,缓解分层学习固有的非平稳性。在ALFWorld、WebShop和Sokoban上的大量实验表明,HiMAC持续优于强提示与强化学习基线,在文本与视觉锚定环境中均取得最先进性能和大幅提升的样本效率。我们的结果表明,引入结构化层次——而非单纯增加模型规模——是实现稳健长时程智能体智能的关键因素。

HiMAC:面向长时程LLM智能体的宏-微分层学习
图1:WebShop 环境中的典型案例比较与整体性能。(a) 扁平策略架构容易在无关观测中迷失(上下文漂移,Context Drift)。(b) HiMAC 通过双层解耦架构(Planner 与 Executor 共享同一个 π θ \pi_{\theta} )解决这种探索低效问题,将结构化蓝图映射为可执行的原子动作。(c) 在多个环境中,HiMAC 相对于先进的 RL 推理基线取得一致的最先进(state-of-the-art)性能。