论文

EvoLM:经协同演化的判别式量规实现语言模型自我进化

EvoLM: Self-Evolving Language Models through Co-Evolved Discriminative Rubrics

模型训练奖励建模与过程监督

摘要

语言模型从预训练中编码了大量评估性知识,但当前后训练方法依赖外部监督(人类标注、专有模型或标量奖励模型)产生奖励信号,各自设有天花板:人类判断无法监督超越自身的能力、专有API制造依赖、可验证奖励只覆盖有标准答案的领域。来自模型自身评估能力的自我改进是随模型规模扩展的奖励源,却基本未被开发。我们提出EVOLM:把这种能力结构化为显式判别式量规并用作训练信号的后训练方法。EVOLM在单个语言模型内交替训练两种能力:(1) 量规生成器:产出以判别效用优化的实例特定评估标准,最大化小型冻结裁判区分偏好与非偏好回复的能力;(2) 策略:以量规条件化分数为奖励训练。所有偏好信号经与早期检查点的时间对比从策略自身输出构造,无需人类标注或外部监督。EVOLM训练的Qwen3-8B生成的量规在RewardBench-2上超GPT-4.1 25.7%;协同训练的策略在OLMo3-Adapt套件平均69.3%,较GPT-4.1提示量规训练的策略高3.9%、较SOTA 8B奖励模型SkyWork-RM高16%。总体而言,EVOLM证明:把模型的评估能力结构化为协同演化的判别式量规,可在无外部监督下实现自我改进。

EvoLM:经协同演化的判别式量规实现语言模型自我进化:论文配图
图 1:EvoLM 概述。我们的方法使单一语言模型能够共同进化其自己的评估和生成能力。通过将潜在知识提取到明确的、特定于实例的规则中,EvoLM 创建了一个自主反馈循环,可以提高策略性能,而无需人工注释或外部教师模型。