论文
知识蒸馏 用于自动化人工智能导师评估
Knowledge Distillation for Automated AI Tutor Evaluation
摘要
大语言模型 (LLM) 快速融入 K-12 和高等教育的速度超过了评估其教学质量的可靠方法的发展速度。随着研究界开始探索 AI 导师自动化评估的空间,我们推出了 FATE(FLC AI Tutor Evaluator),这是一种专门用于评估 AI 导师的 8B 参数语言模型。我们的模型与 BEA 2025 共享任务的四个核心评估轨道保持一致,评估错误识别、错误定位、指导和可操作性方面的教学能力。由于教学评估是一项带有有限标记数据的专门任务,因此我们利用前沿 LLM 中的 知识蒸馏 来生成额外的监督,从而获得高达 22.63 个百分点的绝对性能提升。最后,我们通过对流行商业模型(包括 ChatGPT、Claude、Gemini 和 DeepSeek)生成的指导响应进行基准测试,展示了 FATE 作为自动评估器的实用性。平均而言,我们发现 Gemini 2.5 Flash 表现最好 (82.88%),然后是 ChatGPT 5.5 Instant (80.75%),其次是 DeepSeek V4 Flash (80.13%) 和 Claude Sonnet 4.6 (74.00%)。