论文
CSTutorBench:小语言模型作为积木式编程导师的基准
CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming
摘要
大语言模型日益被探索为AI导师,但在K-12场景部署引发隐私、成本与依赖专有模型的顾虑。小语言模型(SLM)是有前景的替代,但为特定教育语境选对模型仍困难——尤其当目标域(如积木式编程)在训练数据中基本缺失时。我们引入CSTutorBench:评估语言模型作为VEX VR(积木式机器人环境)CS导师的基准。基准含17个场景化问题,按扎根于既定辅导与反馈研究的教学量规评分,配人在环的LLM即裁判评估管线。跨11个模型(4B–120B参数)的初步发现:模型在词汇与语气等表面标准上表现良好,但在更深的教学行为上挣扎——尤其是避免答案泄漏与参与学生调试历史。样本中模型家族与指令微调方式比参数量更能预测辅导质量(模型数量少限制该结论强度)。基于近期教育提示工程研究的定向提示修订改善了11个模型中10个的得分。结果凸显情境特定、教学扎根的基准对教育部署中SLM选型的价值。
