论文
A$^2$TGPO:具有自适应转弯水平剪裁的代理转弯组策略优化
A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping
摘要
代理 大语言模型 (LLM) 的强化学习通常依赖于稀疏的轨迹级结果奖励,因此很难评估多轮交互中单个工具调用的贡献。此类流程贡献分配的现有方法要么依赖于引入额外消耗的单独的外部流程奖励模型,要么依赖于基于树的结构采样轨迹,仅重新分配结果信号,同时限制轨迹多样性。一种有前景的替代方案利用 真值 策略预测概率的每回合变化(称为信息增益 (IG))作为内在过程信号,无需外部评估器。然而,之前在 RL 训练循环中利用 IG 信号的工作面临着三个系统性挑战:对面对异构位置上下文的转弯进行标准化可能会扭曲各个转弯的相对位置,累积可变数量的项会导致优势幅度随轨迹深度漂移,以及固定的裁剪范围对具有截然不同的 IG 信号的转弯进行相同的策略更新。在本文中,我们提出了A$^2$TGPO(具有自适应转弯水平裁剪的代理转弯组策略优化),它保留IG作为内在信号,但重新设计了它的标准化、累积和消耗方式:(i)转弯组标准化:在每个(提示,转弯索引)组内标准化IG,以便每个转弯仅与相同交互深度的同行进行比较; (ii) 方差重新调整贴现累积:将累积归一化 IG 除以累积项的平方根,以保持不同回合位置的优势大小具有可比性; (iii) 自适应转弯水平裁剪:根据其归一化 IG 调整每个转弯的裁剪范围,扩大信息丰富的转弯的更新区域,并缩小信息不足的转弯的更新区域。