论文

先核心集后分数集:LLM基准的评估无监督提示子集选择

Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks

模型评测评测方法与指标

摘要

我们研究LLM基准核心集选择:跨多个基准选一个小的提示子集,使其诱导的模型分数与排名逼近完整基准套件的结果。在评估无监督的基准核心集选择(我们的方法)中,选择算法不使用任何模型评估结果,并以细粒度运行——产出跨多个基准的提示子集而非整基准的子集合。我们使用次模子集选择,为此开发并评估多种次模函数:基于行列式点过程(DPP)的方法、次模互信息函数与设施选址函数。在一个新的大规模套件——35个异构基准、跨五个能力类别、18个前沿LLM、超过6.1万提示——上:仅基于廉价语义提示嵌入运作的设施选址(FL)函数,在一系列核心集预算下保持LLM分数的效果优于十二个独立的基于分数与基于多样性的基线。此外,我们的目标不限于评估无监督regime:在必须只选少数整基准、且有大量模型分数可用的设定中,同一目标在MMLU与MTEB排行榜上匹敌或超越最先进基线,而计算成本显著更低。结果表明次模性总体上是基准压缩的强而可靠的工具。

先核心集后分数集:LLM基准的评估无监督提示子集选择:论文配图
图 6:归一化基准-基准相似性矩阵 MM(等式 12),纯粹根据提示嵌入计算。明亮的条目 Mb​b′M_{bb^{\prime}} 表示基准 bb 和 b′b^{\prime} 冗余地覆盖嵌入空间的同一区域;该矩阵是基准级设施位置贪婪算法所使用的相似度,可产生表 5 中的排序。