论文
支持向量评分标准:缩小自生成评分标准与人类评分标准之间的差距
Support Vector Rubrics: Closing the Gap Between Self-Generated and Human Rubrics
摘要
基于评分标准的评估是判断 大语言模型 (LLM) 输出的一种有前途的范例,但自行生成的评分标准落后于硬实例上的人工注释标准。我们认为这种歧视性差距反映了客观的不匹配:自行生成的标准描述了良好的反应,而有效的标准必须区分接近的候选人。为了弥补这一差距,我们引入了 SVR(支持向量评分标准),这是一个框架,它将评分标准构建重塑为针对偏好数据的最大边缘边界学习。 SVR 将偏好对中的对比特征挖掘到评分标准库中,学习即时条件选择器和全局评分标准权重,并通过支持对选择和硬负例的对抗性探测迭代地完善该评分库。在推理时,仅给出提示,SVR 就会从银行检索最重要的评分标准并对响应进行评分。在 RubricBench 上,SVR 将与人类参考评分标准的差距从 24.1 点缩小到 0.3 分,并且优于强大的自我评分标准和法官基线,并且学习到的银行可以在法官之间进行转移,而无需重新培训。在 RewardBench 1&2 和 RM-Bench 上,它与专用奖励模型保持竞争力,展示了更广泛的奖励建模能力。总体而言,边界定义规则为缩小 LLM 评估中的歧视性差距提供了一条原则性途径。