论文

HLE多项选择子集的维度性与测量精度

Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset

模型评测评测方法与指标

摘要

Humanity's Last Exam(HLE)被广泛用于评估前沿语言模型。HLE将题目组织为八个学科领域类别,其子分数常被解读为不同能力的证据。然而,尚无研究检验这些标签是否对应经验上可分离的潜在构念,也无研究检验该基准能否有效区分能力相近的模型。我们让29个LLM在HLE的纯文本多项选择子集(J = 428题)上作答,并应用心理测量学方法评估该基准的维度性及其测量精度的分布。拟合双参数logistic IRT模型后,我们发现收敛的证据表明HLE测量的是单一的一般推理因子:McDonald's ω_h = 0.998,领域标签仅解释3.5%的题目反应方差,领域内与领域间的残差相关几乎相同(Cohen's d = 0.016),且领域特定的能力估计与总分近乎冗余(r ≥ 0.81)。对测验信息函数的单独分析显示,测量精度集中在中等能力水平,并在θ = 0以上急剧下降,而前沿模型正位于该区间。这些发现表明,HLE的学科子分数不足以支撑各不相同的能力解读,且该基准区分最强模型的能力有限。

HLE多项选择子集的维度性与测量精度:论文配图
图 1:项目难度 (bb) 和项目歧视 (aa) 的分布。