论文
APPO:代理程序策略优化
APPO: Agentic Procedural Policy Optimization
摘要
代理强化学习(RL)的最新进展极大地提高了 大语言模型 代理的多轮工具使用能力。然而,大多数现有方法将贡献分配给粗略的启发式单元,例如工具调用边界或固定工作流程,使得很难确定哪些中间决策影响下游结果。在这项工作中,我们从两个角度研究代理强化学习:\textit{在哪里分支以及分支后如何分配信用}。我们的试点分析表明,有影响力的决策点广泛分布在整个生成的序列中,而不是集中在工具调用上,而词元熵本身并不能可靠地反映它们对最终结果的影响。受这些观察的启发,我们提出\textbf{代理程序策略优化(APPO)},它将分支和贡献分配从粗粒度交互单元转移到序列中的细粒度决策点。 APPO 使用分支分数来选择分支位置,该分支分数将词元不确定性与后续延续的策略诱导的可能性增益相结合,从而实现更有针对性的探索,同时过滤掉虚假的高熵位置。它进一步引入了程序级优势扩展,以更好地跨分支轨迹分配信用。 13 个基准测试的实验表明,APPO 持续将强代理 RL 基线提高了近 4 个点,同时保持高效的工具调用和行为可解释性。