论文
PEARL:通过教学上一致的强化学习来训练苏格拉底式导师
PEARL: Training Socratic Tutors with Pedagogically Aligned Reinforcement Learning
摘要
大语言模型(LLM)显示出作为教育导师的强大潜力。现有的方法通常训练他们解决问题并提供正确的答案,但这种以解决问题为中心的范式忽视了有效辅导的关键要求:渐进式指导和多轮互动中多个教学目标的协调。培养这样的导师仍然具有挑战性,因为学生的行为随个人知识状态的不同而有很大差异,教学效果取决于最终答案正确性之外的多种因素,并且在导师与学生的互动中协调这些目标本质上是困难的。为了应对这些挑战,我们提出了 PEARL,这是一种用于训练苏格拉底式辅导代理的教育学对齐强化学习框架。首先,我们引入了一个可控的学生模拟器,它将潜在的认知状态与响应生成分开,从而能够模拟不同的能力和误解。其次,我们开发了一个教学一致的奖励模型,共同评估教学质量和客观正确性。最后,我们提出了一种稳定的多目标强化学习方法,可以平衡导师训练期间相互竞争的教学目标。跨多个基准的实验表明,PEARL 的性能与辅导专用开源系统和领先的专有 LLM 相比具有竞争力。