论文
大语言模型用于学习者建模的问题:为什么仅靠LLM难以承担K-12教育中的负责任辅导
Problems With Large Language Models for Learner Modelling: Why LLMs Alone Fall Short for Responsible Tutoring in K--12 Education
摘要
基于大语言模型(LLM)的辅导系统在K-12教育中的快速兴起,造成了一种误解,即生成式模型可以取代传统的学习者建模来实现自适应教学。这在K-12场景中尤其成问题,因为欧盟《人工智能法案》将其归类为需要负责任设计的高风险领域。受这些担忧推动,本研究综合了关于LLM辅导系统局限性的证据,并实证考察其中一个关键问题:随时间推移评估学习者不断演化的知识时的准确性、可靠性与时间一致性。我们使用一个大型开放获取数据集,将深度知识追踪(DKT)模型与一个被广泛使用的LLM进行比较,后者分别在零样本和微调两种设置下评估。结果显示,DKT在下一步作答正确性预测上取得最高判别性能(AUC = 0.83),并在各设置下始终优于该LLM。尽管微调使该LLM的AUC较零样本基线提升约8%,但仍比DKT低6%,且在序列早期产生更多错误,而错误预测恰恰在早期对自适应支持的危害最大。时间分析进一步表明,DKT保持稳定且方向正确的掌握度更新,而LLM各变体则表现出明显的时间性缺陷,包括不一致和方向错误的更新。尽管微调后的LLM需要近198小时的高算力训练、远超DKT的计算需求,这些局限依然存在。我们对多技能掌握度估计的定性分析进一步显示,即便经过微调,LLM产生的掌握度轨迹仍不一致,而DKT保持了平滑连贯的更新。总体而言,研究结果表明,仅靠LLM不太可能达到成熟智能辅导系统的有效性,负责任的辅导需要纳入学习者建模的混合框架。
