论文
能力前沿:基准漏掉82%的模型性能
The Capability Frontier: Benchmarks Miss 82% of Model Performance
摘要
既有基准通常报告单模型单次运行的准确率。这系统性低估真实世界LLM能力——尤其在异构数据分布下:(i) 不同模型依其专长答对不同问题;(ii) 给定预算——可采样多次生成并选择性保留。为量化该缺口——我们介绍能力前沿(Capability Frontier):模型集合上的Pareto前沿——刻画在跨模型与跨生成的最优选择(即经神谕)下、每个成本水平的最佳可达性能。我们的构造校正两种相反偏差:单模型评估的低估与对噪声样本取最大值的高估。我们研究横跨编码、推理、医学、事实性、指令遵循与智能体任务的16个广泛使用基准上的21个LLM——在匹配成本下比较能力前沿性能与各基准最佳单模型。校正单模型评估使错误率降54%;再校正单次运行提升82%——SOTA准确率在成本降85%下被匹敌。补充这些实证结果——我们用受控概率仿真表明更高的查询主题熵使神谕路由与最佳单模型的性能差距近单调增长。我们的发现提示集体LLM能力被大幅低估——对数据异构、多域设定下的评估与部署有影响。
