论文
小语言模型作为基于评分标准的强化学习的评判者
Small Language Models as Judges for Rubric-Based Reinforcement Learning
摘要
基于Rubric的强化学习通过根据特定实例的标准对响应进行评分,将强化学习扩展到具有精确答案或基于规则的验证器的任务之外。然而,这使得奖励计算成本高昂:训练需要重复的评分标准判断,通常使用专有 API 或具有 7B 或更多参数的本地生成 LLM 判断。我们研究较小的语言模型是否可以充当高效且可靠的基于规则的法官。为了使这个问题可测量,我们构建了 PointRubric 和 RaR-Science-Static,这是两个基于点的评估数据集,具有特定于实例的标准和逐项满意度标签。我们比较了从小模型中提取标准级判断的三种方法:生成判断、是/否 Logprob 边距和探测判断。在这两个数据集中,Qwen3-1.7B Probe 判断在这些方法中实现了最强的标准级别一致性,优于 Generative 和 Logprob 判断。用作 GRPO 奖励模型,它在 RaR-Science 评分标准上训练从 0.232 到 0.643 的策略,而 8B 生成判断基线的得分为 0.594,而该基线需要多 10.7$\times$ 的奖励判断时间。任务和领域转移实验进一步表明,探索法官在不同的设置中保留了标准级别的奖励结构。