论文

BayesAME:贝叶斯主动模型评估

BayesAME: Bayesian Active Model Evaluation

模型评测评测方法与指标

摘要

跨基准评估大型生成模型非常耗时且计算成本高昂。这就推动了对能够通过仅评估项目子集(称为核心集)的模型来估计完整基准性能的方法的需求。目前的文献大多要求从业者输入核心集大小。然而,当可靠的性能估计优先于效率时,评估方法还应该能够自动确定反映该优先级的核心集大小。我们引入 BayesAME,这是一个专门针对自动确定核心集大小的顺序贝叶斯框架。 BayesAME 通过定义共享相同历史模型性能的每组项目的潜在能力,将性能建模为随机变量,并使用联合先验分布编码目标模型的行为与这些历史模型类似的信念。这些能力的后验分布用于导出性能估计器、量化性能不确定性,并通过信息增益标准选择要添加到核心集的项目。核心集被迭代地增强,直到性能估计波动和性能不确定性低于各自的用户定义的阈值。我们提出了一种多目标扩展,可以捕获多个目标模型之间的性能相关性,以进一步减小核心集大小。通过跨不同基准的广泛实验,我们证明 BayesAME 始终优于现有方法的顺序适应。至关重要的是,我们的综合分析解决了文献中最近的怀疑,确定非随机核心集选择比随机选择更有优势。最后,我们强调,利用连续响应对数似然而不是传统的二进制分数可以显着提高估计准确性。