论文
一致且独特:通过相似图上的最大独立集提示选择 LLM 基准效率
Consistent and Distinctive: LLM Benchmark Efficiency via Maximum Independent Set Prompt Selection on Similarity Graphs
摘要
通过综合基准评估 大语言模型 (LLM) 既昂贵又耗时。我们提出了一个基于图的提示选择框架,将每个基准建模为相似图——如果节点的嵌入空间距离高于可配置的阈值,则提示连接节点——并应用最大独立集(MIS)算法来选择最大多样性、非冗余子集。我们评估了四个 MIS 求解器(CPLEX、GREEDY、Online-MIS、ReduMIS),涉及六个嵌入模型、三个距离测量、六个百分位数阈值和四个基准(GPQA、IFEval、MMLU-Pro、Omni-MATH),涵盖 66 个 LLM。我们的中心假设——在不同随机种子下的重复选择会产生一致的 LLM 排名,也可能与全基准基线不同——得到了强烈证实:Kendall 在 99.2% 的随机配置中的 $W \geq 0.90$(平均 $W = 0.997 \pm 0.008$),而在较高的百分位阈值下,选择的子集实现了 25--48\% 的快速减少平均。与完整基准测试 ($ρ< 0.95$) 的排名差异仅出现在 15.95\% 的配置中,集中在低阈值 ($p_{10}$--$p_{20}$) 和基准测试 (GPQA、IFEval) 上,将过于密集的图识别为主要故障模式。