论文

协助困境:通过多轮强化学习学习教学

The Assistance Dilemma: Learning to Teach via Multi-Turn Reinforcement Learning

模型训练强化学习

摘要

接受过回答问题训练的大语言模型(LLM)天生不擅长教学。针对模拟学生模型的强化学习 (RL) 是一种很有前景的改进教学方法的方法,但现有的经过 RL 训练的导师会奖励学生模型在辅导问题上的成功,而导师的话仍然在上下文中。通过告诉学生模型答案最容易提高奖励,并且需要调整惩罚来减少告诉。借鉴学习科学,我们引入了一种屏蔽的近迁移后测试:学生模型在辅导问题的一个看不见的变体上进行测试,导师的话语被屏蔽,因此奖励只能通过学生模型自己轮流写的内容来提高。这阻止了学生模型的认知卸载,并允许用两个二元奖励门代替连续惩罚(导师响应的事实正确性,无解决方案切换)。留一法消融表明,学习增益奖励本身并不能将教学与讲述分开:门减少了解决方案的交接,而近转移后测试则改善了域外转移。使用这些奖励设计,我们开发了 Eduardo,这是训练LLM导师的多轮 RL 配方,并用它来训练来自两个不同LLM架构的 4B、9B、14B 和 27B 模型。我们训练后的 Eduardo-27B 模型与 MathTutorBench 上的 Gemini-3.1-Pro 和 TutorMoments 上的 Claude Opus 4.8 相匹配,token的思考速度比前沿模型少 2.4-6.2 倍,这对于交互式辅导很重要。在没有在奖励中提及的情况下,该模型将其对推动理由教师模型移动的使用增加了一倍以上,同时支持衰落(例如,分配独立工作),其回报超出了单问题对话事件的范围。我们开源了训练环境、包含 8,671 个问题的近传输数据集以及经过训练的模型以供进一步开发。

协助困境:通过多轮强化学习学习教学的原论文方法或结果图
图 1:MathTutorBench 上的错误诊断与教学法。我们的模型 (Eduardo) 改进了各种规模的基础教学法,同时保持了诊断准确性。