论文

次模基准选择

Submodular Benchmark Selection

模型评测评测方法与指标

摘要

跨众多基准评估大语言模型成本高昂,而许多基准高度相关。我们把「选取小的有信息量子集」形式化为多元高斯模型下的次模最大化。熵(协方差的对数行列式)与已选基准和剩余基准间的互信息成为自然目标。两者均为次模;熵选择与主元Cholesky重合并具有谱残差界,互信息一般非单调但在小子集上经验性单调,故用贪心优化。在来自十个公开排行榜的三个矩阵上的实验显示,小子集情形下互信息选择在填补(imputation)任务上优于熵选择。