论文

ELBench:面向教育的多维度基准 大语言模型

ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models

模型评测基准与评测资源

摘要

大语言模型 越来越多地作为导师、助教和内容生成器部署在教育领域。这些角色提出了普通问答所没有的要求:一个可用的面向教育的模型应该是准确的,在敏感提示下安全,对教学有用,同时与教学目标保持一致。现有的基准在很大程度上孤立地评估这些要求,因此没有一个基准将面向教育的适用性作为综合概况进行评估。我们推出了 ELBench,这是第一个在通用协议下对相同模型评估所有四个要求(一般能力、安全可信、基础教育和高水平培养)的基准,将精选的公共资源与新合成的安全和培养数据相结合。我们评估了九个模型、七个前沿通用系统和两个教育专用变体,并报告了三项研究结果。首先,模块级别的配置文件比单一聚合信息更丰富:前六名模型在总体得分上在统计上无法区分,但它们的模块领导者差异很大,并且安全性与实践教学反相关(r = -0.83)。其次,中国自主研发的车型在安全模块方面领先,是套件中最具辨识度的;这种优势在特定区域的规范性内容上最大,而在普遍危害性内容上则缩小,但不会消失。第三,两个教育专业模型都不主导教育模块,而在高层次培养上,所有模型都存在一个系统盲点:在结构化判断任务上,它们都集中在相同的非参考选项上,偏爱教学风格而不是与既定目标的契合度,因此该模块得分一致较低,并且没有分离模型。这提出了但没有解决域 后训练 是否与教育任务的前沿系统保持同步的问题。