论文

能力前沿:基准漏掉82%的模型性能

The Capability Frontier: Benchmarks Miss 82% of Model Performance

模型评测评测方法与指标

摘要

既有基准通常报告单模型单次运行的准确率。这系统性低估真实世界LLM能力——尤其在异构数据分布下:(i) 不同模型依其专长答对不同问题;(ii) 给定预算——可采样多次生成并选择性保留。为量化该缺口——我们介绍能力前沿(Capability Frontier):模型集合上的Pareto前沿——刻画在跨模型与跨生成的最优选择(即经神谕)下、每个成本水平的最佳可达性能。我们的构造校正两种相反偏差:单模型评估的低估与对噪声样本取最大值的高估。我们研究横跨编码、推理、医学、事实性、指令遵循与智能体任务的16个广泛使用基准上的21个LLM——在匹配成本下比较能力前沿性能与各基准最佳单模型。校正单模型评估使错误率降54%;再校正单次运行提升82%——SOTA准确率在成本降85%下被匹敌。补充这些实证结果——我们用受控概率仿真表明更高的查询主题熵使神谕路由与最佳单模型的性能差距近单调增长。我们的发现提示集体LLM能力被大幅低估——对数据异构、多域设定下的评估与部署有影响。

能力前沿:基准漏掉82%的模型性能:论文配图
图 1:能力前沿:根据提示进行的动态 LLM 选择在我们的 16 个基准中明显优于任何固定的 LLM。来自 App 的示例数据点。显示B。对于任何给定的成本预算,相对于单一大语言模型,可以实现显着的质量改进。相反,对于固定的质量阈值,通过动态大语言模型选择可以实现大量成本节省。