论文

超越直接回答:通过启发式强化学习将教育 LLM 调整为苏格拉底指南

Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning

模型训练强化学习

摘要

在教育环境中部署的 大语言模型 (LLM) 通常表现为直接回答者:它们在开头揭示目标概念,而不是像苏格拉底教学法所规定的那样引导学生通过渐进式探究。我们提出了 HeuristicEdu,一个两阶段的管道,通过监督预热和组相对策略优化 (GRPO) 将 Qwen2.5-7B 与苏格拉底式辅导结合起来。训练使用 SocraticEdu,从直播平台重构的 797 条多回合中国儿童科学对话,对认知深度 (R_cog)、好奇心投入 (R_eng) 和直接性 (R_dir) 进行启发式奖励,以及对学生引入的术语进行 K_query 修正。我们引入支架有效性(SE)和对话深度(CD)来评估表面流畅性之外的结果。在 30 个保留问题上,最佳 GRPO 变体将 SE 从 30.0% 提高到 63.3%,并将关键字泄漏从 30.0% 降低到 13.3%。值得注意的是,这个最佳变体在优化过程中忽略了直接性惩罚,这表明显式的抗泄漏项可能与基于梯度的行为对齐相冲突。未对齐的 Qwen-72B 基线达到 0% SE 和 96.7% 泄漏,表明仅规模不会引起苏格拉底行为。