论文

评估失败的尺度法则:为什么简单平均在数据稀疏和项目难度差距下崩溃,以及项目响应理论如何跨域恢复 真值

The Scaling Law of Evaluation Failure: Why Simple Averaging Collapses Under Data Sparsity and Item Difficulty Gaps, and How Item Response Theory Recovers Ground Truth Across Domains

模型评测评测方法与指标

摘要

人工智能和安全关键领域的基准评估绝大多数依赖于简单的平均。我们证明,当两种情况同时出现时,这种做法会产生严重误导性的排名:(1)评估矩阵稀疏,(2)项目难度差异很大。通过跨 NLP (GLUE)、临床药物试验、自动驾驶车辆安全和网络安全这四个领域的受控模拟实验,我们表明简单平均排名和 真值 排名之间的 Spearman 排名相关性 $ρ$ 从 100% 覆盖率的 $ρ= 1.000$ 降到 67% 覆盖率的 $ρ= 0.809$,且具有高难度异质性(平均超过 20 个种子)。标准二参数逻辑 (2PL) 项目响应理论 (IRT) 模型在所有条件下均保持 $ρ\geq 0.996$。 150 条件网格扫描稀疏度 $S \in [0, 0.70]$ 和难度差距 $D \in [0.5, 5.0]$ 证实排名误差形成具有强 $S \times D$ 交互作用的失败面($γ_3 = +0.20$,$t = 13.05$),而 IRT 始终保持 $ρ\geq 0.993$。我们讨论了物理人工智能基准测试的影响,其中评估矩阵通常不完整且难度差距极大。