论文

PP-S:为各细分领域的AI评测估计引入平滑与验证

Prediction-Powered Smoothing and Validation for Disaggregated AI Evaluation

模型评测评测方法与指标

摘要

评估人工智能系统需要进行分类评估,因为性能因领域而异,例如基准任务类型或已部署代理中的对话类型。详尽的测试成本高昂,因此评估取决于标记单元的样本。我们将评估集视为有限总体,并寻求每个域平均值的准确点和区间估计。直接估计器,包括预测驱动推理 (PPI),仅使用域自己的标签,并且在标签很少的情况下不精确。小区域估计解决了这个问题,我们在此基础上开发了一个用于估计和验证的集成工作流程。对于估计,我们提出了预测驱动平滑(PP-S),这是一种适合每个领域的预测驱动估计的贝叶斯模型,并具有借用报告分类法(PP-TS)优势的扩展。为了进行验证,我们得出了一个新的、近似无偏的基于设计的交叉验证分数,用于在直接估计量和平滑估计量之间进行选择。我们研究了一个精心策划的基准,该基准具有可验证的分级和由人工分级的部署代理流量,每个基准都观察到每个结果。在这两种情况下,所提出的估计量都改进了点估计和区间估计中的直接估计量,具有接近标称的覆盖范围。在相同的抽样预算下,我们的分数选择以及独立的验证样本所做的那样,并且更准确地估计所选估计器的误差。