论文
STABLEVAL:人工智能系统的分歧感知和稳定评估
STABLEVAL: Disagreement-Aware and Stable Evaluation of AI Systems
摘要
人类评估仍然是评估现代人工智能系统的主要标准,但注释者的分歧、偏见和变异性使得系统排名在标准多数投票聚合下变得脆弱。多数投票会放弃注释器的可靠性和项目级的模糊性,通常会在注释器子集之间产生不稳定的比较。我们引入了 STABLEVAL,这是一个分歧感知评估框架,它对潜在项目正确性和特定于注释者的混淆模式进行建模,以产生后验预期项目信用和校准的代理级别分数。与 Dawid-Skene 等标签去噪方法不同,STABLEVAL 明确设计用于稳定和不确定性感知系统评估,而不是硬标签恢复。我们将排名稳定性形式化为一流的评估目标,并分析聚合方法如何保留或扭曲潜在的注释器行为。在受控合成实验和多个真实世界的人类注释基准中,多数投票在注释者异质性和对抗性噪声下表现出分数误差增加和排名不稳定,而 STABLEVAL 产生更稳定且基于统计的系统排名。这些结果表明,建模分歧对于稳健且可重复的人工智能评估至关重要。