论文
O*NET-BENCH:职业测量的LLM评委审计
Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
摘要
LLM评委日益用于判断AI输出是否达到职场要求,但对响应排序的一致并不确立对接受率或职业聚合的一致。我们提出O*NET-BENCH审计套件,源自45796份工人评分的调查,在4501条测试评分上评估六个模型族的33种既有评委配置。25种配置达到至少0.60的含平局对准确率,但一个仅用响应的TF-IDF拟合基线几乎追平最强评委。尽管排序一致,评委估计3.0%-97.9%的响应可接受,而职业匹配工人为61.1%。在一个微调谱系中,从逐点打分换成捆绑少样本/列表式协议改善了响应排序,却降低与工人均值在任务与职业层级的一致;该反转在任务与工人双分离的验证划分上按预定标准复现。交叉验证校准基本消除均值偏置,但校准后分数至多解释个体工人评分方差的8.5%。预测辅助估计在所研究标注预算下至多带来小的精度增益。结果表明仅排序一致不足以支撑职业测量:应按评委分数将要估计的接受率与聚合来验证评委。