论文
从掌握画像到模拟作答:用于忠实 LLM 学生模拟的随机学生知识图谱(SSKG)
From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation
摘要
大语言模型(LLM)越来越多地被用于模拟不同掌握程度的学生。这类模拟可以生成合成训练数据并对辅导系统进行压力测试。然而,常见的基于提示的方法把作答决策留给 LLM,而 LLM 即使被指示模拟低掌握度的学生,也倾向于按其内置能力作答。因此,这些方法可能难以区分低掌握水平和高掌握水平的学生。我们使用 379 道 College Board 校准的 SAT 代数题和五个原型掌握画像展示了这一局限:来自三家厂商的三个 LLM(Gemini 3.1 Flash Lite、Claude Haiku 4.5 和 GPT-5.4-mini)在所有画像上都达到 96.8–100% 的准确率。为解决这一局限,我们引入一种基于随机学生知识图谱(SSKG)的方法。从一本开放的代数教科书中抽取课程知识图谱(CKG),并把每道 SAT 题的解法分解为所需三元组链。SSKG 为每个三元组分配掌握概率,通过采样决定题目正误,再由 LLM 生成与结果一致的第一人称理由。该模拟把准确率降至各画像 44.1–85.2%,并产生清晰的单调掌握梯度。