论文
PhGPO:面向长程工具规划的信息素引导策略优化
PhGPO: Pheromone-Guided Policy Optimization for Long-Horizon Tool Planning
摘要
大语言模型(LLM)智能体的最新进展展示了通过工具使用执行复杂任务的强大能力。然而,长程多步工具规划颇具挑战,因为探索空间会遭遇组合爆炸。在这种情形下,即使找到了正确的工具使用路径,它通常也只是被当作当前训练的即时奖励,无法为后续训练提供任何可复用的信息。本文主张,历史上成功的轨迹包含可复用的工具转移模式,可以在整个训练过程中加以利用。受蚁群优化的启发——其中历史上成功的路径可由信息素体现——我们提出信息素引导策略优化(Pheromone-Guided Policy Optimization,PhGPO),它从历史轨迹中学习基于轨迹的转移模式(即信息素),然后使用学到的信息素引导策略优化。这一学到的信息素提供了显式且可复用的引导,使策略优化偏向历史上成功的工具转移,从而改进长程工具规划。全面的实验结果证明了所提PhGPO的有效性。
