论文
LLM 排行榜对隐藏模型选择的敏感度如何?
How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?
摘要
LLM 排行榜的收益可以反映私人评估的模型变体中的选择,但变体的数量及其依赖性都不是公开的。我们询问发布的利润可以支持多少个隐藏变体,同时保留提供商相对于固定比较器的优势的统计证据。对于高斯边际模型下的固定候选家庭,我们得出一条敏感性曲线,该曲线将最大计数报告为家庭内相关性下限的函数。相关相关性必须与用于排名和抽样模型的分数相匹配:在受控家庭中,合并项目相关性为 0.90,而项目重抽样下的综合得分相关性为 0.46,而 MMLU 受试者重抽样时,综合得分相关性为 0.92。对 Open LLM 排行榜上 394 项相邻排名的申请进行基于项目的审计发现,其中 391 项甚至在考虑选择之前就缺乏统计支持。在通过未经修正的测试的声明中,认证可以依赖于对隐藏家族相关性的假设。由此产生的曲线使这些假设变得明确,而无需估计未观察到的搜索大小。