论文

PhGPO:面向长程工具规划的信息素引导策略优化

PhGPO: Pheromone-Guided Policy Optimization for Long-Horizon Tool Planning

模型训练强化学习Agentic RL

摘要

大语言模型(LLM)智能体的最新进展展示了通过工具使用执行复杂任务的强大能力。然而,长程多步工具规划颇具挑战,因为探索空间会遭遇组合爆炸。在这种情形下,即使找到了正确的工具使用路径,它通常也只是被当作当前训练的即时奖励,无法为后续训练提供任何可复用的信息。本文主张,历史上成功的轨迹包含可复用的工具转移模式,可以在整个训练过程中加以利用。受蚁群优化的启发——其中历史上成功的路径可由信息素体现——我们提出信息素引导策略优化(Pheromone-Guided Policy Optimization,PhGPO),它从历史轨迹中学习基于轨迹的转移模式(即信息素),然后使用学到的信息素引导策略优化。这一学到的信息素提供了显式且可复用的引导,使策略优化偏向历史上成功的工具转移,从而改进长程工具规划。全面的实验结果证明了所提PhGPO的有效性。

PhGPO:面向长程工具规划的信息素引导策略优化
图2:PhGPO 概览。现有的基于 RL 的工具规划器通常隐式地吸收经验,使得成功的长程转移模式难以被显式地提炼和复用。PhGPO 引入了一种受 ACO 启发的、基于信息素的显式转移先验,作用于工具-转移边和工具-调用边。信息素通过沉积和蒸发进行更新。在 rollout 生成过程中,更新后的信息素作为轨迹生成期间显式的转移先验,鼓励策略复现历史上成功的工具转移和参数调用。训练遵循渐进式流水线:先进行有监督的下一工具预热以实现稳定初始化,随后进行信息素引导的强化学习,采用渐进式时间表,从经验证的成功轨迹中积累信息素统计量,最终在轨迹生成和策略优化中应用完整的信息素引导。