论文

IB-GRPO:经指标式群组相对策略优化使基于LLM的学习路径推荐与教学目标对齐

IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization

模型训练强化学习RLVRAgentic RL

摘要

学习路径推荐(LPR)旨在生成个性化学习项序列,在遵守教学原则与运营约束的同时最大化长期学习效果。尽管大语言模型(LLM)为自由形式推荐提供丰富的语义理解,把它应用于长程 LPR 充满挑战,原因包括:(i) 在稀疏且延迟的反馈下与最近发展区(ZPD)等教学目标错位;(ii) 专家示范稀缺且昂贵;(iii) 学习效果、难度调度、长度可控性与轨迹多样性之间的多目标交互。为解决这些问题,我们提出 IB-GRPO(Indicator-Based Group Relative Policy Optimization),一个面向基于 LLM 的 LPR 的指标引导对齐方法。为缓解数据稀缺,我们通过遗传算法搜索与教师 RL 智能体构建混合专家示范,并用监督微调对 LLM 热启动。在这一热启动基础上,我们为难度调度设计会话内 ZPD 对齐分数。IB-GRPO 随后使用 Iε+ 支配指标在多个目标上计算群组相对优势,避免人工标量化并改善 Pareto 权衡。在使用 Qwen2.5-7B 主干的 KES 模拟器上,在 ASSIST09 与 Junyi 上的实验相对代表性 RL 与 LLM 基线取得一致改进。

IB-GRPO:经指标式群组相对策略优化使基于LLM的学习路径推荐与教学目标对齐
图1:IB-GRPO 的总体框架。阶段 I(上):混合专家数据合成(GA 搜索 + 离线 RL 教师)产出用于 SFT 的示范路径,得到模型 μ sft \mu_{\mathrm{sft}} 。阶段 II(下):从 SFT 模型出发,我们对每个提示采样 K K 条候选路径,计算多目标奖励,并经由基于 I ϵ + I_{\epsilon+} 的适应度导出组相对优势,使策略朝 Pareto 前沿更新。