论文

StudentSim:训练基于 LLM 的学生模拟器

StudentSim: Training LLM-based Student Simulators

模型训练监督微调与指令调优

摘要

当人工智能导师适应每个学生的优势、劣势和首选指导时,它们是最有用的,但从真实学习者那里收集哪种指导适合哪个学生的证据很少、缓慢且成本高昂。学生模拟器可以提供此信号作为代理,但现有方法是有限的:状态跟踪模型适合学生行为,但很难处理解释或纠正,而 LLM 角色扮演可以流畅地遵循指导,但不能可靠地匹配被模仿学生的能力。我们提出了 StudentSim,一个训练框架,通过集中训练和每个学生的专业化,将稀疏的每个学生数据转变为个性化的模拟器。由此产生的模拟器既反映了学生自己的反应,又在导师的指导下更新它们。我们还推出了 StudentSimEval,这是一个标准化协议,涵盖国际象棋、第二语言英语写作和数学领域的 60 名学生,使用公共学习者数据集和共享的去识别化记录以供研究。 StudentSimEval 衡量行为保真度 (F),或者模拟器与学生反应的匹配程度,以及指导响应性 (R),或者在导师指导下更新的容易程度,所有方法都在相同的记录上拟合和评估。在所有三个领域中,StudentSim 在这两个指标上都优于 GPT-5.4。在国际象棋中,StudentSim 达到 F=0.51 和 R=0.91,而 GPT-5.4 为 0.23 和 0.72,Maia2 为 0.45 和 0.27。作为概念证明,使用 StudentSim 作为导师强化学习的奖励模型产生了一个国际象棋导师,专家认为该导师比无 RL 基线和针对 GPT-5.4 模拟器奖励训练的导师更准确、更好的指导和更个性化。代码可在 https://github.com/microsoft/StudentSim 获取。