论文

RubricBench:使模型生成的评分量规与人类标准对齐

RubricBench: Aligning Model-Generated Rubrics with Human Standards

模型评测基准与评测资源

摘要

随着大语言模型(LLM)对齐从简单补全演进到复杂、高度精细的生成,奖励模型正日益转向量规引导的评估以缓解表层偏差。然而,社区缺乏评估这一范式的统一基准,因为现有基准既缺乏判别性复杂度,也缺乏严谨分析所需的真值量规标注。为弥合这一空白,我们提出 RubricBench,一个包含 1,147 组成对比较的精选基准,专门用于评估基于量规评估的可靠性。我们的构建采用多维过滤流水线,针对具有细微输入复杂性和误导性表面偏差的困难样本,并为每个样本补充严格从指令导出的专家标注原子量规。全面实验揭示了人工标注与模型生成量规之间的巨大能力差距,表明即使最先进的模型也难以自主制定有效的评估标准,明显落后于人类引导下的表现。

RubricBench:使模型生成的评分量规与人类标准对齐
图1:RubricBench构建与评估设置概览。从现有偏好数据出发,我们通过多维筛选精选出具有挑战性的偏好对,并通过带质量控制的三阶段流水线为其标注仅含指令(instruction-only)的人工评分准则(rubric)。