论文
GRADE:人工智能导师的通用推理感知对话评估
GRADE: Generalizable Reasoning-Aware Dialogue Evaluation for AI Tutors
摘要
评估人工智能导师的反应需要的不仅仅是事实的正确性:导师必须识别错误、定位错误、提供指导并提供可行的后续步骤。我们提出了 GRADE,这是一项针对学生与导师对话中教学能力评估的开源模型的系统研究。在 BEA 2025 TutorMind 设置的基础上,我们评估了五种语言模型、零样本推理、LoRA 微调、合成增强、CoT+推理以及单任务与多任务公式的 120 种配置。 Gemma3-12B 在单任务评估方面表现最佳,而 8 位精度的 Gemma3-27B 对于多任务预测更可靠。我们发现增强有助于处理原始数据的模型,尽管成本较高,但验证增加的收益有限,而 CoT+推理对于合成数据生成比直接分类更有用。我们进一步表明,结构化分类目标上的 LoRA 微调 会干扰思维模式下的指令遵循行为,从而将生成重定向为偏离所需的评估格式。碳分析表明,模型选择和推理模式对排放量有显着影响。总体而言,GRADE 表明,精心挑选的开源 LoRA 管道可以在关键教学维度上匹配或超越专有和基于集成的系统,代码和数据可在 https://github.com/pvbgeek/GRADE 上获取。