论文

通过教学适配指数评估并改善LLM AI辅导的教学适配性

Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index

模型评测评测方法与指标

摘要

大语言模型(LLMs)越来越多地被用作人工智能导师,但正确的答案并不总是适合教学的。在课堂学习中,有效的帮助不仅取决于正确性,还取决于响应是否匹配学习者的当前基础、课程序列和概念引入的时间。现有的评估主要关注答案的质量,而这种适应性教学效果不足测量。我们提出了学识适宜度指数(PSI),这是一个由六项理论导向的子分数组成的复合指标,用于评估LLM生成的辅导回应与学习者准备程度和课程进度之间的契合度,并进一步将PSI作为反馈信号来改善响应。我们使用配对的标准和缺陷性提示在240个场景评估中跨四个测试模型进行评价,然后应用PSI引导的再生协议处理62个表现不佳的情况。四款测试模型之间的基线差异总体上较小(PSI范围:0.557到0.638),开放型和封闭型模型在教学适应性方面没有明显的分离。在测试提示扰动下,整体PSI保持相对稳定(Delta = -0.002),但子分数之间的权衡出现了变化。更重要的是,基于PSI的反馈显著改善了表现不佳的情况:62个案例中有51个(82.3%)得到了改进。针对62个被选中的PSI低分案例进行手动评估提供了初步证据表明识别出的问题是教学有意义的,并且许多基于PSI的再生对应于人类评判后的改进。这些结果表明,与模型类别相比,学习者和课程之间的契合度可能对有效的辅导更为重要,而且这种契合度既可测量又可改善。