论文
TRIAGE:用于代理强化学习的角色类型贡献分配
TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
摘要
代理强化学习需要将功劳分配给面向环境的操作,例如搜索、单击、编辑、导航命令和对象交互。标准 GRPO 使用最终验证者结果作为相对于所有操作词元的统一优势。这个结果信号是有用的,但结构上不完整:它惩罚失败执行轨迹中的有用探索,并强化成功执行轨迹中的冗余或倒退行动。我们提出了 TRIAGE,一种角色类型的贡献分配框架,为结果信用添加了语义角色轴。结构化法官将每个细分分类为决定性进展、有用探索、无进展基础设施或回归,并且固定的角色条件规则将这些标签映射到有界细分级流程奖励。这使得验证者的结果成为优化方向的来源,同时纠正了仅结果信用的两个主要盲点。我们进一步表明,贝叶斯最优角色可测量校正是每段优势残差到角色变量的 L2 投影,并且 TRIAGE 的固定角色常数近似于该投影,只要判断可靠,就会减少优势估计误差;我们将其与低方差策略梯度联系起来。在 ALFWorld、Search-QA 和 WebShop 中,TRIAGE 提高了两种策略模型的 GRPO 成功率,并且优于标量法官衍生的过程奖励和结果监督的共享骨干价值基线。消融表明,收益来自角色类型,而不仅仅是添加密集奖励:成功轨迹内回归的可靠检测是主要贡献者,而探索信用提供了一致的次要收益;在完成 ALFWorld 和 WebShop 任务轨迹上,相对于 GRPO,TRIAGE 还减少了与环境交互的轮次额外 $10.4\%$ 和 $14.8\%$。