论文

RecurSE:LLM 评分标准的有界递归自我评估

RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges

模型训练强化学习

摘要

LLM 作为法官对于评估开放式文本和指导 后训练 至关重要,但改进法官本身通常依赖于昂贵的注释、奖励模型或来自更强大教师的 蒸馏。在这项工作中,我们从 RL 训练奖励中消除了外部黄金监督:模型自身的评估能力为其优化生成学习信号——一种称为递归自我评估 (RecurSE) 的有界递归自我改进 (RSI) 的闭环设置。我们研究两个核心问题:自我完善何时可以发生,何时必须停止?首先,RecurSE 将一个可训练的法官与一个同步策略副本检查器配对,该法官根据每个规则的规则评估候选人的响应(第 1 步),该检查器根据元规则审核法官的推理,以提供标量过程奖励(第 2 步)。为了实现学习,界面解耦在结构上将检查者的标量分数与法官的判决词元隔离开来,从而消除了夸大自我分配奖励的退化词元复制捷径。其次,由于非锚定递归学习本质上是有界的,因此配对优势有效性(PAV)可以作为无偏验证监视器,联合跟踪判断准确性和检查器保真度,以可靠地识别最佳提前停止窗口。在 Qwen3.5-9B、Gemma-4-E4B-it 和 Qwen3.6-27B 中,RecurSE 在保留的医疗、成对、总结和专业基准测试中实现了一致的泛化增益。消融表明,同步判断器-检查器共同进化优于冻结检查器、外部元判断器、自我一致性和缩放教师 蒸馏。此外,我们的法官策划的偏好对有效地增强了下游政策的一致性。因此,当自我产生的奖励有效性被明确解耦和监控时,作为法官的 LLM 的有界 RSI 是可行的。