论文

BACON:预算人工校准,用于多个人工智能法官的建模和评估

BACON: Budgeted Human Calibration for Modeling and Evaluation with Multiple AI Judges

模型评测评测方法与指标

摘要

人工智能法官为人类评估提供了一种可扩展、低成本的替代方案,但其输出可能相对于人类偏好存在偏差,并且高度依赖于项目,在不同法官、任务和领域之间存在差异。当未经校准的人工智能评估用于模型排名、项目评分或群体质量报告时,这些偏差可能会直接扭曲下游决策。我们提出了 BACON,这是一个四阶段管道,它将预算人类校准与多个人工智能判断输出相结合,以产生更准确的注释。 BACON 为每个项目构建了全覆盖的辅助特征,包括多评判分数、词元级 不确定性统计和上下文嵌入。然后,它收集小样本子集的人类标签,并训练交叉拟合的结果模型以生成校准的项目级替代预测。这些预测支持两种用例:使用具有有效置信区间的增强估计方程估计器对汇总指标(例如均值或分位数)进行总体水平估计;以及用于项目排名和注释的个人级别替代评分。 BACON 将人工智能判断视为辅助测量,而不是 真值:人类标签提供校准锚,而人工智能衍生的信号提高效率。在不同的任务、领域和标签预算中,BACON 提高了预测准确性和排名一致性,并减少了相对于原始人工智能输出和纯粹基于人类标签的方法的偏差和方差。这些结果表明,BACON 提供了一个实用的、基于统计的框架,可通过有限的人工注释进行可扩展的评估。