论文

EvoRubrics:通过 LLM 强化学习的对抗性共同进化将动态 Rubrics 作为奖励

EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

模型训练奖励建模与过程监督

摘要

基于评分标准的奖励为无法获得可验证答案的开放式任务中的强化学习提供了可解释且细粒度的优化信号。然而,预先构建的规则在整个训练过程中保持静态,与不断发展的政策产生根本性的不匹配:随着模型的改进,固定标准逐渐失去区分能力,导致奖励饱和和潜在的黑客攻击。最近的动态评价标准方法部分解决了这个问题,但依赖于外部前沿模型或 真值 答案,并且仅以粗粒度更新评价标准。我们提出了 EvoRubrics,这是一个共同进化的 RL 框架,其中策略 LLM 和 Rubric 生成器通过每个训练步骤中的对抗性交互来共同改进。随着政策在标题生成器的指导下改进,标题生成器会调整其标准以保持区分性和信息性,从而使评估能够实时跟踪政策并自然地引入自动课程。实验表明,EvoRubrics 在各个基准测试中始终优于静态和动态评分基准。学习到的 Rubric 生成器进一步概括为可转移的奖励模型。值得注意的是,即使是在没有任何外部监督的情况下完全自我监督的变体也能获得有意义的收益,这表明仅生成和评估之间的共同进化就可以提供足够丰富的学习信号。我们的代码可在 https://anonymous.4open.science/r/EvoRubrics-2155/ 上公开获取。