论文

Alice:德语多维评分准则简答基准

Alice: A Large-Scale German Benchmark for Rubric-Based Multi-Dimensional Automatic Short Answer Scoring

模型评测应用与实践基准与评测资源模型能力评测行业应用

摘要

自动简答评分 (ASAS) 是教育 NLP 的核心。然而,公开可用的基准仍然稀缺,现有数据集主要解决学生直接回答问题的程度,而不是他们掌握热能等基本概念(知识元素)或推理或主张等认知活动(技能)的程度。为了解决这一差距,我们引入了 Alice,这是一个大规模的、基于标题的德国 ASAS 数据集,该数据集在教学上是一致的,包含三个子任务:(i) 学习表现 (Alice-LP)、(ii) 知识元素 (Alice-KE) 和 (iii) 技能 (Alice-SK)。我们进一步将基于评分标准的 ASAS 制定为评分检索任务,并使用一系列语言模型(从仅编码器模型到轻量级LLM)对数据集进行基准测试。我们还通过LLM和标准分类基线使用零样本提示对数据集进行基准测试。实验表明,LLM尤其难以在零样本环境中对知识元素和技能进行评分。他们还指出,标题文本通常很有用,特别是对于 Alice-KE 和 Alice-SK 相对于以样本解决方案为中心的输入而言,Alice-LP 的增益更为温和,并且因模型和输入格式而异。

Alice:德语多维评分准则简答基准:论文原图
图 1:来自 Alice 的实例。每个实例都包含一个问题提示、一个示例解决方案以及针对整体学习表现、知识元素和技能的每个级别的标准。完整的示例如附录中的图 6 所示。