论文
基准的平衡:针对基准重复性与任务条件化评估的语义密度重加权
Balance of Benchmarks: Semantic Density Reweighting for Benchmark Multiplicity and Task-Conditioned Evaluation
摘要
通常通过在具有相同权重的基准列表中平均分数来比较语言模型。此类列表通过在显式测量设计之外的发布而增长,因此等权重将已发布基准的密度转变为隐式能力权重:密集基准测试的区域会重复计数。我们引入了基准平衡(BoB),它嵌入基准描述并为每个基准分配一个逆密度语义权重。附近的条目在公开的密度范围内共享总体影响力。将异构分数等同于公共潜在尺度后,残差字段使用相同的几何形状来调节任务查询上的模型排名。这两个组成部分具有不同的经验作用。根据 586 个模型和 14 个基准的快照,BoB 预测哪些模型在超出其一般能力的任务上异常强大,达到 0.462 的配置文件相关性,而同等权重下为 0.049。它还限制了密集重复的基准对总体的影响。依次添加每个基准的四个副本后,所得排名保留了 0.995 的 Kendall tau,而同等权重下的 Kendall tau 为 0.936。因此,残差场提供了任务条件预测,而逆密度加权则为基准多重性提供了鲁棒性。它们共同将基准列表组成从评估套件的附带属性转变为测量设计的明确、可控部分,为任务感知和多重鲁棒模型评估提供了原则基础。