论文
HiMAC:面向长时程LLM智能体的宏-微分层学习
HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents
摘要
大语言模型(LLM)智能体近来在交互式决策中展现出强大能力,但在需要结构化规划与可靠执行的长时程任务上仍存在根本局限。现有方法主要依赖扁平的自回归策略,高层推理与低层动作在单一token序列中生成,导致低效探索和长轨迹上的严重错误传播。在这项工作中,我们提出HiMAC,一个分层智能体式RL框架,把长时程决策显式分解为宏观规划与微观执行。HiMAC把推理建模为结构化蓝图生成过程,随后进行目标条件动作执行,使基于LLM的智能体实现稳健的长时程规划。为高效训练这一层次结构,我们引入无评论者的分层策略优化范式,通过分层相对优势估计把基于群组的强化学习扩展到双层结构。此外,我们提出迭代协同演化训练策略,在规划器探索与执行器适应之间交替,缓解分层学习固有的非平稳性。在ALFWorld、WebShop和Sokoban上的大量实验表明,HiMAC持续优于强提示与强化学习基线,在文本与视觉锚定环境中均取得最先进性能和大幅提升的样本效率。我们的结果表明,引入结构化层次——而非单纯增加模型规模——是实现稳健长时程智能体智能的关键因素。
