论文
作为教育评估设计队友的小型私有语言模型
Small, Private Language Models as Teammates for Educational Assessment Design
摘要
生成式AI日益支持教育设计任务,例如通过大语言模型(LLM),已展现出设计与教学框架(如布鲁姆分类法)对齐的评估题目的能力。然而,这些工作往往依赖主观或有限的评估方法,主要聚焦专有模型,或很少系统考察真实教育场景中的生成、评估与部署约束。与此同时,小型语言模型(SLM)作为更能兼顾隐私与资源限制的本地化替代方案兴起,但其在评估任务上的有效性仍缺乏探索。为填补这一空白,我们系统比较LLM与SLM在评估题目设计上的表现;使用可复现、有教学依据的指标评估其在布鲁姆分类法各层级上的生成质量;并通过分析可靠性与一致性模式,进一步将模型评审与专家参与式评估相对照。结果显示,SLM在教学动机驱动的关键质量维度上表现具有竞争力,同时支持本地化、隐私敏感的部署。然而,相对于专家评分,基于模型的评估也表现出系统性的不一致与偏差。这些发现为把语言模型定位为评估工作流中的有界助手提供了证据,凸显了人在回路(Human-in-the-Loop)的必要性,并通过考察质量、可靠性与面向部署的权衡推进了自动化教育题目生成领域。
