论文
用于分析排行榜稳定性和操纵性的统一扰动框架
A Unified Perturbation Framework for Analyzing Leaderboard Stability and Manipulation
摘要
LMArena 等评估排行榜通过将成对的人类偏好汇总到模型排名中,在 大语言模型 基准测试中发挥着核心作用,但这些排名的稳健性仍然知之甚少。我们提出了一个统一的扰动框架,用于使用基于影响力的近似来分析结构化数据修改下的 Bradley-Terry 排行榜。我们的框架研究三种比赛级别的扰动(Drop、Add 和 Flip)以及玩家移除,并评估它们对 top-k 成员资格、通过 Kendall tau 的全局排名一致性以及基于置信区间的不确定性的影响。在 Chatbot Arena 和另外六个成对比较数据集中,我们表明现代排行榜在所有三个目标上都是不稳健的:低于 1% 的目标扰动可能会改变排名靠前的模型、降低 Kendall 的 tau 值并改变置信区间。除了鲁棒性审计之外,我们还表明,相同的影响力分数可以实现有效的有针对性的扰动,提升或降级特定模型,并通过比以前的操纵和主动采样基线更少的操作来减少目标模型的不确定性。通过用归一化的数据集级稳健性分数总结这些影响,我们的框架提供了一个实用且有用的工具,用于审核排行榜稳定性并激励更稳健的评估协议。