论文
NTCIR-19 LLM 自动评估 2 (AEOLLM-2) 任务概述
Overview of the NTCIR-19 Automatic Evaluation of LLMs 2 (AEOLLM-2) Task
摘要
在本文中,我们概述了 NTCIR-19 LLM 2 自动评估 (AEOLLM-2) 任务。基于 NTCIR-18 核心任务 AEOLLM 的成功,我们为 NTCIR-19 提出了 AEOLLM-2,以进一步研究大型语言模型(LLM)的自动评估方法,特别是在长文本生成场景中。在 AEOLLM-2 中,我们引入了一个新的子任务“深度研究评估”,该任务专注于自动评估LLM生成的长篇深度研究报告。参与者开发了评估方法来自动评估这些报告的质量,并通过将其分数与人类注释的真实标签进行比较来衡量每种方法的性能。今年,我们总共收到了来自 10 支球队的 91 场比赛。本文介绍了任务的背景、数据集的构建、评估措施、参与者的方法以及最终的评估结果。