论文

Skill-RM:通过代理技能统一异构评估标准

Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill

模型训练智能体系统奖励建模与过程监督Agent Skills

摘要

奖励模型 (RM) 为 LLM 后训练 提供关键反馈信号,特别是在强化 微调 (RFT) 和强化学习 (RL) 管道中。然而,当前的奖励评估依赖于异构标准,例如基于规则的验证器、真值 参考文献、程序清单和复杂的规则,其中整合所有类型证据的统一机制尚未探索。为此,我们提出了技能奖励模型(Skill-RM),这是一个统一的框架,它将奖励模型重新表述为可重复使用的奖励评估技能的执行。通过将奖励计算视为结构化代理任务,Skill-RM 提供了一致的接口来编排异构资源,动态选择和聚合根据每个输入的特定要求定制的证据。这种方法使奖励模型超越静态评估,确保不同任务的一致性和透明度。对奖励基准和下游应用程序(包括 N 中最佳选择和强化学习)的广泛实验表明,Skill-RM 始终优于传统的判断基准。我们的研究结果表明,Skill-RM 不仅为奖励建模提供了统一的解决方案,而且还通过证据的战略和动态编排实现了卓越的性能。代码位于 https://github.com/Qwen-Applications/Skill-RM。