论文
EvoRubric:用于开放式生成的自我进化 Rubric 驱动的 RL
EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation
摘要
强化学习 (RL) 在可验证领域显着推进了 大语言模型 (LLM),但由于缺乏明确的奖励,调整开放式生成模型仍然极具挑战性。当前基于标题的强化学习方法通过采用明确的标准来缓解这一问题;然而,它们严重依赖静态的、人工注释的规则,这不可避免地会导致策略滞后,或者用于动态更新的昂贵的外部专有模型。在本文中,我们提出了 EvoRubric,这是一种新颖的单策略协同进化 RL 框架,消除了对静态标准和外部 rubric 生成器的依赖。通过在单个参数化策略下统一响应生成和 Rubric 生成,EvoRubric 在 Reasoner 和 Rubric 生成器之间动态交替。为了防止 奖励作弊 并确保生成信号的可靠性,我们引入了多级验证管道,具有元验证器、零方差剪枝和留一对等共识机制。验证的标准被动态归档到内存池中,产生密集的多目标奖励,以持续共同优化这两个角色。跨医学、写作和科学领域的大量实验表明,EvoRubric 始终优于传统静态和外部 LLM 驱动的对齐方法。值得注意的是,我们的框架与人类专家的先验兼容。当使用专家注释的量规进行初始化时,EvoRubric 可以进一步发现新颖的、有区别的维度,从而获得比仅依赖静态专家注释更好的性能。