论文

对重要任务进行基准测试:用于保留模型排名的数据集选择

Benchmarking on Tasks That Matter: Dataset Selection for Preserving Model Rankings

模型评测评测方法与指标

摘要

机器学习模型的基准通常包括许多数据集,使得评估成本高昂。为了提高效率,最好对小型、有代表性的数据集进行评估。此类子集的选择通常依赖于启发式方法,并且很少分析所得模型排名的稳健性。我们引入了一个框架来执行选择数据集子集的任务,并评估不同的选择策略如何保持全局模型排名。我们的框架包括引导聚合,它提供有效的置信区间,允许对选择策略进行原则性比较。我们考虑聚类、设计标准(A/D 最优)、随机基线和贪婪最远优先 (FAFI)。对于后者,我们根据排名误差得出选择质量的上限,作为所选数据集数量的函数。根据经验,在时间序列分类(TSC,112 个数据集)和从 MTEB(57 个任务)派生的补充自然语言处理基准中,与随机子集(包括简单的 FAFI)相比,多种选择策略可以改善排名保留。相比之下,在推荐系统(30 个数据集)中,策略相对于随机选择的改进很小,并且通常在统计上不显着。对于 TSC,我们表现最佳的策略仅使用五个选定的数据集,与完整基准模型排名的 Spearman 相关性达到 0.95。其他实验表明,选择方法的有效性取决于数据集表示的质量和基准制度的规模。