论文
RubricBench:使模型生成的评分量规与人类标准对齐
RubricBench: Aligning Model-Generated Rubrics with Human Standards
摘要
随着大语言模型(LLM)对齐从简单补全演进到复杂、高度精细的生成,奖励模型正日益转向量规引导的评估以缓解表层偏差。然而,社区缺乏评估这一范式的统一基准,因为现有基准既缺乏判别性复杂度,也缺乏严谨分析所需的真值量规标注。为弥合这一空白,我们提出 RubricBench,一个包含 1,147 组成对比较的精选基准,专门用于评估基于量规评估的可靠性。我们的构建采用多维过滤流水线,针对具有细微输入复杂性和误导性表面偏差的困难样本,并为每个样本补充严格从指令导出的专家标注原子量规。全面实验揭示了人工标注与模型生成量规之间的巨大能力差距,表明即使最先进的模型也难以自主制定有效的评估标准,明显落后于人类引导下的表现。
