论文
操纵基准有多难?排行榜稳健性的社会选择分析
How Hard is it to Rig a Benchmark? A Social Choice Analysis of Leaderboard Robustness
摘要
多任务基准测试已成为机器学习研究的核心支柱,但它们日益增长的影响力刺激了基准游戏——为提高特定模型的排行榜排名而采取的战略行动。将数据集视为选民,将模型视为候选人,我们将特定于基准的训练(在训练中包含基准数据)视为选举操纵的一种形式。对于任何序数基准,选择数据集进行训练以使目标模型成为顶级的问题对应于轮班贿赂,这是计算社会选择中的一类操纵问题。利用这一识别,我们表明特定于基准的训练问题在 Borda 计数和平均胜率下是 NP 困难的。为了补充这种最坏情况的观点,我们引入了实例级鲁棒性,即模型开发人员在训练中必须包含的最小数据集数量,以在给定的排行榜上名列前茅,并在算术平均值、中位数、平均胜率和成对多数下导出其表达式。我们在 HELM 下的 MMLU 和 Open LLM Leaderboard 下的 BIG-Bench Hard (BBH) 上评估这些表达式。在这两个套件中,平均胜率是最难操纵的:这种差距在 BBH(24 个任务,4507 个模型)上很明显,其鲁棒性中位数为 22 个任务 (92%),而算术平均值下为 13 个任务 (54%),中位数和成对多数下为 12 个任务 (50%)。