论文
DRACO:面向长程智能体训练的动态评分准则与细粒度贡献分配
DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training
摘要
当任务具有程序化检查器时,可验证奖励的强化学习效果很好,但大多数长期代理域都没有。我们在结果盲目的环境中工作,无法获得真实的成功信号。多标准评价是提供此类奖励的一种流行方式。每个轨迹都会进行一次评分,但单个标量在数十步中的信号很差。我们建议 DRACO:为信用优化分配基于规则的优势。它在训练期间动态生成评估标准,以跟踪策略不断发展的能力,对每个完成的轨迹对这些评估标准进行一次评分,并重新分配对负责注释评估标准的步骤的判断,以在 GRPO 中产生差异化的每步优势。重新分配是封闭形式的,并且不引入任何经过训练的归因模块。在 AppWorld 上,尽管本身没有使用任何验证器,但 DRACO 比基本模型获得了 15.9 分,比使用稀疏真实奖励训练的 GRPO 获得了 5.3 分。在域外 Tau-Bench 上,即使没有前沿判断,它也比基本模型获得了 5.3 分,击败了真实奖励训练和其他基于评分标准的训练设置。 DRACO 的代码可从 https://github.com/IBM/draco 获取。
