论文

通过多级注释器建模提高评估的可重复性

Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling

模型评测评测方法与指标

摘要

随着 大语言模型 (LLM) 等生成式 AI 模型变得越来越普遍,确保这些系统的安全性、稳健性和整体可信度至关重要。然而,人工智能目前正面临着由不可靠的评估和不可重复的实验结果驱动的可重复性危机。虽然人类评估者经常被用来评估模型的实用性和安全性,但他们在注释中引入了不同的偏见和主观意见。克服这种差异非常具有挑战性,因为很少有数据可以研究实验可重复性如何随着注释器池的增长而实际提高。标准评估实践通常依赖于每个项目的少量注释(通常为 3 到 5 个),并且缺乏对项目之间的个体差异进行建模所需的持久评估者标识符。在这项工作中,我们引入了一种多级引导方法来真实地建模注释器行为。利用具有大量评分和持久评分者标识符的数据集,我们分析了实现统计显着性所需的项目数量 ($N$) 和每个项目的响应数量 ($K$) 之间的权衡。