论文

通过强化学习和监督的 微调 应用驱动的开源 LLM 教学知识优化

Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised Fine-Tuning

模型训练强化学习

摘要

我们提出了一种创新的多阶段优化策略,将强化学习(RL)和有监督的 微调 (SFT)相结合,以增强 大语言模型 (LLM)的教学知识,如 EduQwen 32B-RL1、EduQwen 32B-SFT 和可选的第三阶段模型 EduQwen 32B-SFT-RL2 所示:(1) RL 优化,实施渐进难度训练,专注于具有挑战性的示例,并采用扩展推理采样轨迹; (2) 随后的 SFT 阶段,利用 RL 训练的模型通过难度加权采样合成高质量的训练数据; (3) 可选的第二轮强化学习优化。 EduQwen 32B-RL1、EduQwen 32B-SFT 和 EduQwen 32B-SFT-RL2 是应用程序驱动的开源教学 LLM 系列,构建在密集的 Qwen3-32B 主干上。这些模型在跨领域教学知识 (CDPK) 基准上取得了足够高的准确度,在交互式教学基准排行榜上建立了新的最先进 (SOTA) 结果,并超越了更大的专有系统,例如之前的基准领先者 Gemini-3 Pro。这些密集的 320 亿参数模型表明,领域专业优化可以将中型开源 LLM 转变为真正的教学领域专家,其性能优于大型通用系统,同时保留负责任的教育人工智能部署所需的透明度、可定制性和成本效率。