论文

GenRubric:用于可扩展 LLM 评估的自我演化评分标准生成

GenRubric: Self-Evolving Rubric Generation for Scalable LLM Evaluation

模型训练强化学习

摘要

大语言模型 越来越多地用作开放式任务的可扩展评估器。然而,许多 LLM 评委在评分过程中得出特定于查询的标准,导致评估要求不够明确,且其覆盖范围难以审核。特定于查询的评分标准使这些要求变得明确,但专家编写的评分标准的构建成本很高,而现有的自动方法通常依赖于推理时间细化或外部监督。我们引入了 GenRubric,这是一个自我进化框架,它可以改进未标记查询的标题生成,而无需在自我进化过程中进行额外的人工注释。我们的方法基于量规引发的自我一致性:同一查询的独立采样量规提供了其潜在评估要求的部分视图,并且综合量规应该引起对这些互补评估视图进行概括的响应。我们通过强化学习来实现这一原则,将跨标题综合性信号与标题质量的群体级和标准级奖励相结合。我们跨多个领域以 4B、8B 和 14B 尺度训练 GenRubric 模型。对人类注释的评分标准基准的实验表明,自我进化提高了生成的评分标准所引发的评估与专家编写的评分标准所引发的评估之间的一致性。这些改进进一步推广到保留域,展示了自我进化的标题生成用于可扩展和特定于查询的 LLM 评估的潜力。代码和模型可在 https://github.com/foggpoy/GenRubric 上公开获取。