论文

DRACO:面向长程智能体训练的动态评分准则与细粒度贡献分配

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

模型训练强化学习Agentic RL

摘要

当任务具有程序化检查器时,可验证奖励的强化学习效果很好,但大多数长期代理域都没有。我们在结果盲目的环境中工作,无法获得真实的成功信号。多标准评价是提供此类奖励的一种流行方式。每个轨迹都会进行一次评分,但单个标量在数十步中的信号很差。我们建议 DRACO:为信用优化分配基于规则的优势。它在训练期间动态生成评估标准,以跟踪策略不断发展的能力,对每个完成的轨迹对这些评估标准进行一次评分,并重新分配对负责注释评估标准的步骤的判断,以在 GRPO 中产生差异化的每步优势。重新分配是封闭形式的,并且不引入任何经过训练的归因模块。在 AppWorld 上,尽管本身没有使用任何验证器,但 DRACO 比基本模型获得了 15.9 分,比使用稀疏真实奖励训练的 GRPO 获得了 5.3 分。在域外 Tau-Bench 上,即使没有前沿判断,它也比基本模型获得了 5.3 分,击败了真实奖励训练和其他基于评分标准的训练设置。 DRACO 的代码可从 https://github.com/IBM/draco 获取。

DRACO:面向长程智能体训练的动态评分准则与细粒度贡献分配:论文配图
图1:达尔富尔地区管理局概况。顶端:法官从指令中提出标准,并选取每一条轨迹;将建议合并、废除和评分,以产生不考虑结果的奖励(Riri})(第3.2节)。底部:在推出小组中,GROP将奖励正常化为轨迹优势AiAi};DRACO然后根据法官的每项标准裁决,跨步重新分配每个AiAi},产生阶梯优势ajaj},这些优势集中在标注所涉及的步骤上(第3.3节)。