论文

每个错误答案都很重要:LLM 多项选择基准的选项级心理测量

Every Wrong Answer Counts: Option-Level Psychometrics for LLM Multiple-Choice Benchmarks

模型评测评测方法与指标

摘要

Most multiple-choice question (MCQ) benchmarks evaluate 大语言模型 (LLM) only by whether they select the correct answers.尽管 LLM 在不正确选项中的偏好可能包含有关其行为和能力的系统且有用的信息,但这种二元评分对所有不正确的响应都一视同仁。我们引入了 LLM 标称响应模型 (LLM-NRM),这是一个选项感知心理测量框架,它对答案选择的完整分布进行建模,以共同估计 LLM 能力和选项级项目特征,同时分离模型特定的响应校准锐度、位置偏好和难度相关的回退行为。在来自 14 个基准的 189 个 LLM 和 31,554 个项目中,LLM-NRM 比二元项目响应模型和传统名义响应基线更准确地预测了保留的 LLM 项目交互,并且其能力估计与外部人类偏好 Arena.ai Elo 排行榜实现了 0.920 的最强 Spearman 相关性。干扰因素身份在正确性之外为每个项目贡献了 +101% 的额外费舍尔信息,并且仅错误的反应就恢复了 Spearman 0.943 的全信息能力估计。学习到的项目参数还可以实现高效的基准测试,其中 41 个选定的项目保留了全库排名,Kendall 相关性为 0.85,相当于减少了 770 倍。 In conclusion, we show that incorrect answers carry distinct and useful measurement information rather than representing equivalent mistakes.