论文
MMLU 实际测量什么?对总基准分数中难度结构的心理计量审计
What Does MMLU Actually Measure? A Psychometric Audit of Difficulty Structure in Aggregate Benchmark Scores
摘要
尽管 MMLU 被广泛采用作为校准通用人工智能能力的基准,但我们通过心理测量证明,其总分主要评估模型的事实检索能力,而不是其推理能力。通过使用项目响应理论校准超过 14,042 个 MMLU 测试项目的 1,000 个开放权重语言模型的项目难度,我们表明通过单个测试评估这两种能力本质上是有缺陷的。然后将难度回归到结构复杂性的确定性、文本可提取框架上。应用联合 Wald 检验与主题聚类协方差表明 MMLU 合并了根本上可分离的结构。从结构复杂性到难度的映射在基准测试的 STEM 和非 STEM 分区中并不是一成不变的。这一发现具有实际意义。总体排行榜排名比 STEM 准确度更密切地跟踪非 STEM 准确度,因此为推理密集型部署选择总体上排名前 50 的模型会取代大约 22% 的适合 STEM 的选择。此外,当控制响应模型内部的多项选择猜测层时,我们发现能力较高的模型在推理深度增加的情况下继续急剧退化。因此,MMLU 聚合对检索能力和推理稳定性的权重不相等,无意中偏向针对检索优化的模型。我们将确定性框架作为可重复的审计工具发布,并建议分类报告。