论文
AT²PO:基于树搜索的 Agentic 轮次制策略优化
AT$^2$PO: Agentic Turn-based Policy Optimization via Tree Search
摘要
LLM 智能体已成为处理多轮任务的强大系统,它将内部推理与外部工具交互交织进行。智能体强化学习(Agentic Reinforcement Learning)作为进一步精炼这些能力的关键后训练范式,近期受到大量研究关注。本文提出 AT²PO(经由树搜索的 Agentic 轮次制策略优化),一个面向多轮智能体 RL 的统一框架,解决三个核心挑战:探索多样性有限、贡献归因稀疏以及策略优化不对齐。AT²PO 引入轮级树结构,同时支持熵引导树扩展(Entropy-Guided Tree Expansion)以实现策略性探索,以及轮次贡献归因(Turn-wise Credit Assignment)以从稀疏结果中进行细粒度奖励传播。与此互补,我们提出 Agentic 轮次制策略优化(Agentic Turn-based Policy Optimization),一种使策略更新与智能体交互的自然决策粒度对齐的轮级学习目标。ATPO 与树搜索正交,可以轻松集成到任何多轮 RL 管线中。在七个基准上的实验表明,相较最先进基线取得一致改进,平均最高提升 1.84 个百分点,消融研究验证了每个组件的有效性。我们的代码可在 https://github.com/zzfoutofspace/ATPO 获取。
