论文

OSCAR:AI 排名的订单感知评分和校准

OSCAR: Order-aware Scoring and Calibration for AI Rankings

模型评测评测方法与指标

摘要

法官特定的敏感性对于汇总成对的 LLM 评估很有用,但其解释取决于排名模型包含哪些系统呈现效果。我们引入了 OSCAR,一种用于评分和校准人工智能排名的订单感知框架,并研究了位置效应之一。在 18 名评估者公布的判断中,所有回答 A-B 的分数差异范围为 -63.11 美元到 98.31 美元百分点。在发布的表格中匹配问题文本、回答文本、候选人身份和判断给出的总体差异为 $24.22$ 点(95% 区间 $[22.90,25.54]$),以发布的文本映射为条件。受控计算隔离了潜在的后果:在真实灵敏度固定为 1 的情况下,省略 4 的位置截距会将总体最优斜率降低到 0.0771 美元。我们使用法官特定的位置、长度和家庭术语扩展基于敏感性的排名,描述局部遗漏引起的位移和识别失败的特征,并将提示集群不确定性传播到调整后的比较。在四个已发布的数据集中,位置提供了最大的独立预测改进。重新拟合引导程序比较显示,与仅位置调整相比,完整模型的增益更具选择性。在相关二元模拟中,调整均值和协方差可产生 94.4--95.2% 的覆盖率;单独纠正其中任何一个都是不够的。在 $N=10{,}000$ 时,OSCAR 将平均中性目标 RMSE 从仅敏感模型下的 $0.1158$ 降低到 $0.0237$。