论文
校正 AI 评估中评分者效应的人类标签:一种项目反应理论方法
Correcting Human Labels for Rater Effects in AI Evaluation: An Item Response Theory Approach
摘要
人类评估在 AI 模型训练与评估中扮演核心角色,但这些数据很少被当作可能受系统性误差影响的测量来对待。本文将心理测量学评分者模型整合进 AI 流水线,以提升从人类判断中所得结论的可靠性与效度。本文回顾了扭曲观测评分的常见评分者效应——严苛度与居中性,并展示项目反应理论评分者模型,尤其是多面 Rasch 模型,如何将真实输出质量与评分者行为分离。以 OpenAI 摘要数据集为实证例子,我们展示调整评分者严苛度后如何产生校正后的摘要质量估计,并为评分者表现提供诊断洞见。将心理测量建模纳入人在回路评估,可以更有原则、更透明地使用人类数据,使开发者基于校正后的分数而非原始易错的评分做决策。这一视角为更稳健、可解释、与构念对齐的 AI 开发与评估实践指明路径。
