论文
在智能体策略优化中协调过程监督与基于结果的贡献分配
Reconciling Process Supervision with Outcome-Based Credit in Agentic Policy Optimization
摘要
基于结果的强化学习为语言模型代理提供经过验证的反馈,但将轨迹级优势统一分配给所有决策,从而在长期交互中产生粗略的信用。按策略自蒸馏通过使用仅在训练期间可用的特权信息 (PI) 重新评估采样行为来提供更精细的监督。然而,细粒度的监督不一定是细粒度的信用:PI引起的可能性变化描述了附加信息如何改变政策偏好,但并不直接确定可执行操作应如何继承经过验证的任务结果。这就造成了监管信用差距。特权信号可能与当前交互状态无关,以与可执行决策不一致的词元粒度进行操作,并且缺乏强化所需的结果语义。我们引入 TASPO,它将特权监管转化为基于结果的行动信用。 TASPO 根据经过验证的成功经验构建决策适用的 PI,在可执行行动级别聚合 PI 引起的似然变化,并将相对行动支持转换为原始轨迹优势上的正的、有界的、均值保留的权重。因此,经过验证的结果决定了更新方向和平均规模,而PI仅在操作之间重新分配信用。在三个代理基准测试中,TASPO 比 GRPO 提高了 10.6%,并且可以更好地泛化到未见过的任务。进一步的分析表明,TASPO 减少了监督失配,并且行动级别的分配稳定了政策优化过程。这些发现为社区提供了另一个有趣的视角。
