论文

LLM 管道中隐藏的测量错误扭曲了注释、评估和基准测试

Hidden Measurement Error in LLM Pipelines Distorts Annotation, Evaluation, and Benchmarking

模型评测评测方法与指标

摘要

LLM 评估推动部署哪些模型、采用哪些安全标准、发布哪些研究结论以及如何预测人工智能对劳动力市场的影响。然而,标准置信区间忽略了判断模型选择、模型温度和提示措辞的变异性,导致覆盖率不足,并且随着数据的增加而变得更加严重。省略的方差可以改变结果足以推翻结论 \citep{baumann2025llmhacking, huang2026dropping};未能对其进行平均的管道留下了“基准黑客”利用\citep{singh2025leaderboard}的表面。本文将 LLM 管道不确定性分解为其来源,将随着数据增多而缩小的方差与研究人员设计选择的敏感性区分开来,并使用设计研究预测来减少总评估误差 (TEE)。在整个演示中,朴素标准误差比 TEE 校正的 SE 小 40 - 60%。使用 Chatbot Arena 数据,我们显示,随着 $n$ 的增长,95\% CI 覆盖率下降,而 TEE 校正覆盖率保持在 95\%,并且 TEE 引导管道将基准游戏表面从 56 限制到 32 Elo ($K=27$),低于人类排行榜基线。我们进一步表明,一个小型试点可以恢复诚实的 CI 和项目,其中设计更改最能提高精度。根据这些预测采取行动,可以以同等成本将 MMLU 相对于答案的估计误差减半,并将 Chatbot Arena 上的每场比赛与人类投票的一致性提高 7.9 个百分点。