论文

Elmes*:长尾教育场景中 大语言模型 细粒度评估量规的自动构建

Elmes*: Automated Construction of Fine-Grained Evaluation Rubrics for Large Language Models in Long-Tail Educational Scenarios

模型评测评测方法与指标

摘要

评估 大语言模型 (LLM) 的教育需要衡量模型的教学方式,而不仅仅是他们所知道的内容。现有的基准强调领域通用的正确性,或者依赖于手动设计的标准,这些标准很难适应长尾教学场景。我们引入 Elmes*,这是一个用于构建、完善和应用细粒度的特定场景规则的端到端框架。 Elmes* 将用于教师-学生-法官互动的声明性多智能体引擎与 SceneGen 相结合,SceneGen 是一个自我进化的模块,可共同优化评估标准和来自专家定义的教学维度的测试数据。我们使用 Elmes* 构建了 Edu-330,涵盖 11 个科目、3 个年级范围和 10 个任务类型的 330 个场景,拥有超过 1{,}000 个二级指标。 Edu-330 和四个专家编写的黄金标准场景的实验表明,教育能力是多维的:顶级 LLM 主要在创造力和价值整合方面有所不同,知识强的模型可能会在苏格拉底脚手架上失败,而教育专业的 InnoSpark 则获得了人类评估的最佳平均分。 LLM 评委保留了与人类可比的排名,评分方差要低得多,但表现出评委特定的偏见,例如自我偏好。消融表明,专家评分的小样本锚定改善了人类-LLM 对齐,而推理执行和贪婪解码则依赖于模型。因此,Elmes* 为基于教学的 LLM 评估提供了可扩展的诊断基础设施。