论文

模拟不投入的学生来评估大语言模型导师

Simulating Disengaged Students to Evaluate LLM-based Tutors

模型评测评测方法与指标

摘要

由计算模型生成的模拟学生提供了一种实用的方法来评估人类和人工智能导师使用的辅导策略和教学方法。然而,这样的模拟应该考虑脱离行为,包括玩弄系统、空转和偏离任务的行为,因为导师可能需要针对不同的学习者状态做出不同的反应。我们提出了脱离感知学生模拟器 (DAS2),这是一种可重复的预部署协议,可以对五种学习者参与状态进行建模:参与、游戏、空转、脱离任务和混合,并评估 AI 导师在这些状态下的表现。使用 ASSISTments09,两名编码员根据匿名交互日志摘要独立标记了 100 个采样辅导课程。他们达成了 84% 的一致性(Cohen 的 kappa = 0.78),并且在达成一致的案例中,人类共识标签在 81% 的案例中与基于 DAS2 规则的标签相匹配(kappa = 0.75)。对目标学习者状态进行调节模拟,将游戏模拟会话与真实会话之间的正确率差距从 0.54 减少到 0.20,将轮盘旋转从 0.51 减少到 0.18。经过微调的 Qwen2.5-7B 更好地匹配真实的响应时间分布,而仅提示的 GPT-4o 生成了更明显的学习者状态。对来自 Claude、Llama、Gemini、Qwen 和 GPT 家族的五位人工智能导师的评估表明,不同学习者州和互动长度的相对排名保持稳定,而绝对表现各不相同,揭示了导师支持方面的特定州差异。人类验证进一步表明,自动导师评估并不完全符合人类判断。 DAS2 提供了一个预部署框架,用于评估人工智能导师在部署前如何应对不同的学习者参与状态。