论文
Sherpa:训练语言模型进行自适应教学
Sherpa: Teaching LLMs to Teach Adaptively
摘要
大语言模型越来越善于解决问题,但会解题不等于会教学。现有教师LLM训练方法依赖示范、偏好数据或预定义教学标准来规定良好教学,却往往不直接依据个体学生的学习成果;不同学习者需要的有效策略可能差异很大。我们提出Sherpa多轮强化学习框架,用不同学习偏好条件化的LLM实例化多种模拟学生原型,并直接最大化其学习成果,训练教师模型调整教学。Sherpa训练的教师LLM使各类受指导模拟学生的表现平均提高20.5个百分点。在MathTutorBench评测下,总体教学得分从52.5%提高至79.2%,表明教学回复更好。人工研究中,79.6%的成对比较更偏好训练后的教师而非基础模型。Sherpa使LLM教师适应多样模拟学生,更贴近人类教师,为向真实学生教学提供路径。
