论文
先核心集后分数集:LLM基准的评估无监督提示子集选择
Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks
摘要
我们研究LLM基准核心集选择:跨多个基准选一个小的提示子集,使其诱导的模型分数与排名逼近完整基准套件的结果。在评估无监督的基准核心集选择(我们的方法)中,选择算法不使用任何模型评估结果,并以细粒度运行——产出跨多个基准的提示子集而非整基准的子集合。我们使用次模子集选择,为此开发并评估多种次模函数:基于行列式点过程(DPP)的方法、次模互信息函数与设施选址函数。在一个新的大规模套件——35个异构基准、跨五个能力类别、18个前沿LLM、超过6.1万提示——上:仅基于廉价语义提示嵌入运作的设施选址(FL)函数,在一系列核心集预算下保持LLM分数的效果优于十二个独立的基于分数与基于多样性的基线。此外,我们的目标不限于评估无监督regime:在必须只选少数整基准、且有大量模型分数可用的设定中,同一目标在MMLU与MTEB排行榜上匹敌或超越最先进基线,而计算成本显著更低。结果表明次模性总体上是基准压缩的强而可靠的工具。
