论文
问哪个而非多好:LLM评分基准的规模测定
Ask Which, Not How Good: Sizing Benchmarks Scored by an LLM
摘要
由LLM裁判打分的基准经常裁决十分之一分的差距,但这些基准的分辨率从未被测量过。现有的样本复杂度研究覆盖准确率型基准,留下裁判评分这一空白。我们把系统作为测量对象,使用概化理论将373,019次评判分解为系统、题目、裁判与交互成分。核心结果是结构性的:在单一裁判下,概化度渐近于sigma2_s/(sigma2_s+sigma2_sj),与题目数量无关,因为系统×裁判项不携带n_i。题目会饱和,裁判不会。当目标接近该上限时,达到目标的题目成本发散。该上限是逐点量规评分的属性,而非LLM裁判的属性。若以两种呈现顺序作为成对偏好运行,sigma2_sj比sigma2_s低两个数量级,上限升至0.986(11个系统上的bootstrap区间[0.934, 1.000]),单个裁判即可胜任。成对比较买到的是另一个问题:先呈现的系统比同一系统后呈现多赢8.6个百分点,这一偏差是我们收集的53项已发表胜率对比所声称改进中位数的1.23倍。协议设计主导面板规模。在原生题目数下,测得的下限在0-5量表上为0.41-1.24分,而已发表改进的中位数为0.28分;在唯一一个出现频率足以做精确匹配比较的基准上,所恢复的全部17项MT-Bench改进都低于MT-Bench自身的下限,70%的胜率主张低于成对下限。对628篇arXiv论文的审计(由两个独立模型双重编码,并经盲评人类编码验证,kappa=0.73)发现,不到四分之一的论文说明了其评测是否运行多次,仅46-67%报告了任何形式的不确定度。