论文
没有中立的评测框架:现代LLM排行榜由配置脆弱的题目制造
There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items
摘要
多项选择基准固定了题目和正确答案,但没有固定评测框架(harness):选项顺序、提示词措辞,以及模型答案是从生成文本读取还是从逐选项似然读取。关于这种框架敏感性的工作把它报告为总体分数方差,未检验方差落在哪些题目上,以及它们是否正是区分模型之间的题目。我们把大语言模型(LLM)的评测框架当作自变量,并将其效应解析到单个题目。我们引入脆弱性网格(fragility grid):来自4个家族的12个开源权重指令微调LLM在26种同样站得住脚的框架配置下回答来自4个基准(ARC、HellaSwag、MMLU、TruthfulQA)的相同3,679道题,为每个模型、题目和配置记录一个正确性比特。这一比较是匹配的,因为题目、权重和贪婪解码保持不变,只有框架在变。在此网格下,模型的分数是一个区间而非一个点:gemma4-31b仅因框架不同得分就在31%到89%之间。三个结果随之而来。在两个相邻模型都稳定作答的题目上,二者打平,而配置脆弱题目平均承载一对模型差距的95.7%。12个模型中有4个在某些配置下排名第一,所以是框架选出了赢家。题目区分度——基准压缩方法所最大化的属性——与脆弱性相关0.28(95%置信区间0.25至0.30),因此压缩保留的恰恰是脆弱题目而非剔除它们。打分方式的选择,而非协议通常固定的选项顺序,才是承重轴。我们公开每题记录和分析脚本,所有数字可在CPU上于数秒内重新生成,并把脆弱性网格定位为排行榜在报告排名之前可以运行的一项检查。
