论文
走向教学上一致的 LLM 数学错误纠正导师
Towards Pedagogically Aligned LLM Tutors for Math Mistake Remediation
摘要
大语言模型在智能辅导系统中具有强大的应用潜力,但它们往往无法遵循有效的教学策略,例如在不透露最终答案的情况下指导学生。我们研究了用于数学错误补救的两阶段对齐管道的应用,将辅导对话上的监督 微调 与合成偏好对上的直接偏好优化相结合。我们构建了一个数据集,将现有的辅导语料库与根据教学维度(例如脚手架和事实性)生成的合成数据相集成,并研究包含解决方案正确性和标准答案的不同输入配置。实验表明,与基本模型和现有的辅导模型相比,这种方法提高了事实准确性和教学质量。人类评估进一步表明,我们的最佳模型具有强大的专有基线的竞争力,同时在开放性、透明度和可重复性方面提供额外的好处。我们的结果强调了基于偏好的教学协调的有效性,同时也揭示了可靠评估辅导质量的挑战。