评估盲点:大语言模型 基准覆盖的体视理论
The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models
摘要
我们给出了LLM基准覆盖率的体视理论。对于任何具有有效维数 d_eff 的套件,具有相同分数的两个凸能力曲线之间的可见 Hausdorff 距离以 epsilon + C R m^(-1/(d_eff-1)) 为界,并具有匹配的 Lipschitz 下界。根据经验,三个独立排行榜(Open LLM v2、扩展的 12 基准套件、LiveBench)在其竞争前沿上的 d_eff 均处于 [2.86, 4.80] 范围内;结构性盲点比观察到的亚军得分差距高出两个数量级,并且比统计噪音高出 52-127 倍。在卡方投影模型下,各向同性先验是乐观情况;在六个隐藏能力先验和四个环境维度中,前两个模型的模拟半分割交换率保持在[0.38,0.49],并且 500 次试验的随机可见/保留分割显示,92% 的试验交换了前 1 排名,5 个前 5 模型中平均有 2.83 个模型发生了变化。具有 Nemhauser (1 - 1/e) 保证的子模贪婪算法找到了 4 个基准的稳定核心; 12 个中的 7 个足以实现 90% 的覆盖率,并且经过训练的子集可以跨时间季度传输,保留率达到 93-97%。跨 12 个内部基准和 27 个 Chatbot Arena 类别的反事实验证证实,特征结构预测哪些评估是不可替代的(rho = -0.69,对于移除中断,p = 0.013)以及哪些外部评估带来新信息(rho = +0.38)。作为第二个独立的理论贡献,我们解决了 C^2 支持函数的加德纳问题 1.5 (1995),通过 S^(D-1) 上的最优恢复理论在一般维度上建立了极小最大速率 Theta(R/(kappa m^(2/(D-1))))。