论文
TeachBench:基于教学大纲的LLM教学能力评估框架
TeachBench: A Syllabus-Grounded Framework for Evaluating Teaching Ability in Large Language Models
摘要
大语言模型(LLM)展现出作为教学助手的潜力,但其教学能力仍未得到充分评估。现有基准主要关注解题或题目层面的指导,使以知识为中心的教学未被充分探索。我们提出一个基于教学大纲的评估框架,通过多轮教学后的学生成绩提升来衡量LLM教学能力。通过将教师智能体限制在结构化知识点和示例题上,该框架避免信息泄漏并能复用现有基准。我们在跨多个学科的高考数据上实例化该框架。实验揭示了教学效果在模型和领域间的显著差异:一些模型在数学上表现良好,而物理和化学的教学仍然具有挑战性。我们还发现,纳入示例题并不必然改善教学,因为模型常转向针对示例的纠错。总体而言,我们的结果凸显教学能力是LLM行为中一个独立且可测量的维度。
