论文
评估LLM在编程入门课程中回答学生问题的能力
Evaluating LLMs for Answering Student Questions in Introductory Programming Courses
摘要
大语言模型(LLM)的迅速涌现为编程教育既带来机遇也带来挑战。虽然学生越来越多地使用生成式AI工具,但直接访问往往因提供完整解答而非教学性提示而妨碍学习过程。与此同时,教育者在提供及时、个性化反馈时面临沉重的工作量与可扩展性挑战。本研究考察LLM在CS1编程课程中安全且有效地协助教育者回答学生问题的能力。为此,我们建立了一套严格且可复现的评估流程:从学习管理系统中整理出170个真实学生问题构成基准数据集,并配以由领域专家撰写的标准答案。由于传统文本匹配指标不足以评估开放式教育回应,我们开发并验证了一个针对教学准确性优化的定制LLM-as-a-Judge指标。我们的发现表明,诸如Gemini 3 flash等模型能够超越典型教育者回应的质量基线,与专家教学标准高度一致。为缓解幻觉等持续存在的风险并确保与课程特定情境对齐,我们倡导“教师在环”(teacher-in-the-loop)的实施方式。最后,我们将方法论抽象为一个与任务无关的评估框架,倡导教育类LLM工具的开发从临时性的部署后测试转向可量化的部署前验证流程。
