论文

没有中立的评测框架:现代LLM排行榜由配置脆弱的题目制造

There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items

模型评测评测方法与指标

摘要

多项选择基准固定了题目和正确答案,但没有固定评测框架(harness):选项顺序、提示词措辞,以及模型答案是从生成文本读取还是从逐选项似然读取。关于这种框架敏感性的工作把它报告为总体分数方差,未检验方差落在哪些题目上,以及它们是否正是区分模型之间的题目。我们把大语言模型(LLM)的评测框架当作自变量,并将其效应解析到单个题目。我们引入脆弱性网格(fragility grid):来自4个家族的12个开源权重指令微调LLM在26种同样站得住脚的框架配置下回答来自4个基准(ARC、HellaSwag、MMLU、TruthfulQA)的相同3,679道题,为每个模型、题目和配置记录一个正确性比特。这一比较是匹配的,因为题目、权重和贪婪解码保持不变,只有框架在变。在此网格下,模型的分数是一个区间而非一个点:gemma4-31b仅因框架不同得分就在31%到89%之间。三个结果随之而来。在两个相邻模型都稳定作答的题目上,二者打平,而配置脆弱题目平均承载一对模型差距的95.7%。12个模型中有4个在某些配置下排名第一,所以是框架选出了赢家。题目区分度——基准压缩方法所最大化的属性——与脆弱性相关0.28(95%置信区间0.25至0.30),因此压缩保留的恰恰是脆弱题目而非剔除它们。打分方式的选择,而非协议通常固定的选项顺序,才是承重轴。我们公开每题记录和分析脚本,所有数字可在CPU上于数秒内重新生成,并把脆弱性网格定位为排行榜在报告排名之前可以运行的一项检查。

没有中立的评测框架:现代LLM排行榜由配置脆弱的题目制造:论文配图
图1:同一个模型、同样的条目、众多分数。模型按参考排行榜顺序沿轴排列,最好的在顶部。每行从鲁棒准确率(模型在全部26种harness配置下都答对的条目,左侧刻度线)延伸到乐观准确率(在至少一种配置下答对的条目,右侧刻度线),参考配置得分由圆点标出。同一行内不同的只有harness。对 gemma4-31b,该行从0.04延伸到0.98,而参考harness给它记入的0.88只是该区间内的一点。在12个模型上平均,85%被记入的正确答案可以被一个同样站得住脚的配置翻转为错误,这就是为什么单一的排行榜数字是从一个宽区间中取出的一点,而非模型自身的属性。