论文
金标准的幻想:对长文本生成的人类评估协议的大规模分析
Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation
摘要
人工评估在评估生成文本的质量方面起着至关重要的作用。然而,这些评估的可靠性和可重复性取决于透明且记录良好的协议——当前实践中经常缺少的细节。在这项工作中,我们对人类评估协议进行了大规模分析,用于评估 2023--2025 年 *CL 会议出版物中的长格式生成任务,包括对 284 篇论文的完整人工审查和对另外 1.8k+ 篇论文的 LLM 辅助分析。我们定义了一组与人类评估研究的可重复性相关的 20 条可报告标准,并应用这些标准来系统地检查社区内的报告规范和实践。我们发现人类评估研究设计的重要方面普遍存在漏报,导致测量内容、测量方式、谁做出判断以及如何解释判断等方面的模糊性。基于这些发现,我们概述了可行的建议,以支持未来研究中更透明和可重复的报告。我们的分析代码和带注释的数据集可以在以下位置找到:https://github.com/larchlab/Illusions-of-the-Gold-Standard