论文

SHARPO:按执行分段分配Agent强化学习贡献

SHARPO: Segment-Level Credit Assignment for Agentic Reinforcement Learning

模型训练奖励建模与过程监督

摘要

Agentic 强化学习 (RL) 训练大语言模型 (LLM) 以在长时间、多步骤的交互中发挥作用。然而,单个局部错误可能会导致任务失败,而轨迹级奖励为将功劳分配给个人决策提供了有限的指导。为了解决这一限制,我们引入了策略优化的分段级事后优势重新加权(SHARPO),这是一种贡献分配机制,可在面向环境的分段级别细化组相对策略优化(GRPO)。受现有的策略自蒸馏 (OPSD) 方法的启发,SHARPO 计算每个分段内的师生对数概率差距,并使用所得信号来计算 GRPO 优势的有界乘数。该乘数由该分段内的所有词元共享,从而允许信用在不同分段之间有所不同。借助 Qwen2.5-7B-Instruct,SHARPO 的性能优于 ALFWorld 和 WebShop 基准测试的现有基准,包括 GRPO、SDAR、RLSD 和 StepOPSD。