论文

Sherpa:训练语言模型进行自适应教学

Sherpa: Teaching LLMs to Teach Adaptively

模型训练强化学习Agentic RL

摘要

大语言模型越来越善于解决问题,但会解题不等于会教学。现有教师LLM训练方法依赖示范、偏好数据或预定义教学标准来规定良好教学,却往往不直接依据个体学生的学习成果;不同学习者需要的有效策略可能差异很大。我们提出Sherpa多轮强化学习框架,用不同学习偏好条件化的LLM实例化多种模拟学生原型,并直接最大化其学习成果,训练教师模型调整教学。Sherpa训练的教师LLM使各类受指导模拟学生的表现平均提高20.5个百分点。在MathTutorBench评测下,总体教学得分从52.5%提高至79.2%,表明教学回复更好。人工研究中,79.6%的成对比较更偏好训练后的教师而非基础模型。Sherpa使LLM教师适应多样模拟学生,更贴近人类教师,为向真实学生教学提供路径。

Sherpa:训练语言模型进行自适应教学:论文原图
图 1:我们的框架概述。 教师模型通过准备、辅导和测试与学生模型原型进行交互,并根据学生模型的改进获得辅导奖励。 学生模型 原型由带有门控机制的 骨干模型 模型实现。