论文
接近平局的 LLM 排名对于 Family-DIF 指导的基准重组是否稳健?
Are Near-Tied LLM Rankings Robust to Family-DIF-Guided Benchmark Recomposition?
摘要
排行榜上的小差距通常被解释为一种语言模型优于另一种语言模型的证据,但其标志可能取决于包含哪些基准项目。我们使用来自五个基准的项目级响应和多维项目响应理论(MIRT)的无族标签谱近似来对此进行测试。在所有者不相交的折叠中,一半所有者识别出跨模型系列具有低残差差异项目功能的项目(低DIF);另一半得到的冻结的、源和容易性平衡的权重评分模型,同时同样短的匹配随机子测试控制通用子测试变化。全基准排名和低 DIF 排名仍然密切相关 ($τ_b=.900$--$.948$)。然而,在五个基准中的四个中,30.9--47.1% 的跨家庭配对最初在 1 个百分点的反向顺序内,超出其匹配随机中位数 16.9--28.6 个百分点(所有 $p=.001$)。第五个基准显示没有可靠的超额($-0.9$ 点,$p=.689$)。该模式在所有预先指定的人口扰动和剩余项目中仍然存在——家庭签名在所有者的一半之间复制;然而,没有一个家族在基准测试中表现出一致的优势。因此,全球稳定的排名仍然可能使个别接近平局的排序对基准构成敏感,并且低于一分的排行榜差距应该伴随有证据表明隐含的排序是稳健的。