论文

Agentic 强化学习的依赖感知奖励塑造

Dependency-Aware Reward Shaping for Agentic Reinforcement Learning

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

当使用强化学习训练大语言模型时,终端奖励几乎无法提供关于哪些步骤重要的指导。分配步骤学分的常见方法忽略了基于未纠正错误的工作被浪费,而独立工作仍然有效。由于只有最终的成功/失败奖励,失败剧集中的每一步的未来总奖励为零,即使它取得了进展。我们提出依赖感知奖励塑造(DARS),它将任务进度表示为由先决条件关系链接的谓词,并在依赖图上分配步骤级信用。注释器标记每个步骤验证、无效或修复的谓词。经过验证的谓词根据距最近的损坏先决条件的图形距离进行折扣,而独立谓词不受影响。维修根据剩余的任何错误更新这些权重;无效的谓词需要重新验证才能重新获得信用。固定的潜力将这些注释转换为签名的每步奖励。通用的奖励和注释接口允许 DARS 与一系列推理和 Agentic 训练方法(例如 GiGPO 和 ARPO/AEPO)集成,而无需更改其rollout策略或优化器。在从 1.5B 到 8B 的五个任务系列和模型中,DARS 比使用相同预算和工具 (ALFWorld) 训练的 GiGPO 提高了多达 10 个百分点,提高了 WebShop 任务得分和 Search-R1 QA 准确性,通过 Python 解释器补充了 AEPO 在 AIME24/25 上基于熵的训练,并在 1.7B 和 4B 的受控无工具推理比较中超过了 OmniOPD。消融表明,步骤级信用、依赖性衰减和图拓扑各有贡献。在 ALFWorld 上,经过精炼的 8B 注释器与 API 注释器相匹配,使 DARS 能够在没有前沿判断的情况下高效运行。代码可在 https://github.com/JianhuiWei7/DARS. 获取