论文

配对 LLM 评估的分辨率诊断

Resolution Diagnostics for Paired LLM Evaluation

模型评测评测方法与指标

摘要

在两个公开的 LLM 排行榜中,许多显示的配对排名在实际配对评估设计下不符合传统的配对测试分辨率目标:40 个开放 LLM 排行榜 v1 配对比较中的 11 个和 9 个 MMLU-Pro 前 10 个相邻排名对中的 4 个在 (alpha, 1-beta) = (0.05, 0.8) 处未解析。在真实主题级别聚类下,MMLU-Pro 计数上升至 6/9,并且在 99.9% 的类别引导重采样中保持在 9 中的 5-6。我们将配对 LLM 评估构建为假设检验问题,反转水平 alpha、幂 (1-beta) 测试,并报告每对分辨率 q = N/N* 作为主要诊断。具有显式二阶常数的急剧小效应展开表明,广泛使用的不成对的 Co​​hen-h-plus-(1-rho) 捷径在密切比较机制中偏离正确的 N* 大约为两倍,当用户将其每臂输出后乘以 (1-rho) 时,五个现成计算器中的三个(Cohen 1988,G*Power,R pwr)默默地继承了这一缺陷。未解析的配对模式仍处于多重校正和随时有效的顺序测试中。