论文

CollabEval:通过矩阵补全进行统计上高效的协作模型评估

CollabEval: Statistically Efficient Collaborative Model Evaluation via Matrix Completion

模型评测评测方法与指标

摘要

评估生成式人工智能模型是一个常规但资源密集的过程,在模型开发过程中会反复进行。在这项工作中,我们提出了协作评估(CollabEval),这是一种简单、有效且有原则的方法,用于利用不同模型在同一任务上的历史运行之间的依赖关系来提高统计效率。具体来说,我们的方法将模型评估视为评估分数 $M \times N$ 矩阵上的矩阵完成问题,其中 $M$ 是模型总数,$N$ 是评估提示总数。我们假设这些 $M$ 模型的子集是评估的目标。对于这些目标模型,只有一小部分提示 $p$ 已用评估分数进行注释。利用预测驱动推理的最新结果,我们构建了分数矩阵的低秩近似,并使用重建值作为控制变量,以保证真实评估指标平均值的无偏估计以及统计上有效的置信区间。根据经验,在各种数据集、模型和稀疏度 $p$ 范围内,我们发现与相同注释预算的基线方法相比,CollabEval 大大降低了平均置信区间大小和点估计的均方误差。