论文
排行榜的排名区间:模型评估的分层框架
Rank Intervals for Leaderboards: A Hierarchical Framework for Model Evaluation
摘要
通常在多任务排行榜上评估预训练模型,以衡量其在不同环境中的适用性。然而,当前将跨任务的表现汇总到排行榜级别排名的方法并没有解决任务级别的不确定性和可变性。虽然最近的工作提出了基于区间的模型排名,但从单个任务到排行榜级别排名的不确定性的原则性聚合仍未得到解决,并且跨任务的模型性能变化经常被掩盖。在这项工作中,我们引入了一个分层框架,该框架在两个级别上构建具有统计保证的模型排名区间:来自成对比较的任务级别排名置信区间,以及使用共形方法的排行榜级别预测区间。这使得能够对每个观察到的任务和新的潜在任务的模型排名进行可靠的量化。对模拟数据以及 TabArena 和 PromptEval (MMLU) 基准的实验表明,我们的方法产生统计上有效且信息丰富的区间,从而能够在排行榜上实现可靠的、不确定性感知的模型排名。