论文

Dr.Credit:基于评分规则分配深度研究Agent的过程贡献

Dr.Credit: Rubric-Grounded Process Credit Assignment for Deep Research Agents

模型训练奖励建模与过程监督

摘要

基于评分标准的任务越来越多地通过强化学习 (RL) 来解决,并将评分标准分数用作训练奖励。然而,这些奖励通常会监督最终答案,而不区分中间决策的贡献。许多现有的信用分配方法依赖于真实答案来定义过程奖励,限制了它们对没有规范解决方案的开放式任务的适用性。为了解决这一限制,拟议的基于评分规则的信用使用任务要求作为最终答案评估和过程监督的共享参考。评估工具返回的信息,以确定其为满足每个标准(相对于该标准已接受支持的历史)提供的额外支持。通过参考这些历史,信用将新的支持与轨迹中已有的证据区分开来,同时识别每个评分规则的部分支持。 http://Dr.Credit 使用基于评分规则的信用来监督深度研究Agent的 RL 框架中的中间工具轮换。由此产生的流程优势与 GRPO 结果优势相结合,指导研究决策,同时保留对最终报告质量的监督。对四个域内和域外基准的评估表明,http://Dr.Credit 在每个主要指标和子指标上都优于评估的开放深度研究基线。同时,通过 8B 参数主干,经过训练的智能体达到了与评估的前沿专有模型相媲美的平均性能。进一步的分析表明,在有限的研究转向预算下,可以更有效地获取证据并获得更高质量的报告,从而推动将基于规则的过程监督扩展到更广泛的基于规则的任务。