论文
IB-GRPO:经指标式群组相对策略优化使基于LLM的学习路径推荐与教学目标对齐
IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization
摘要
学习路径推荐(LPR)旨在生成个性化学习项序列,在遵守教学原则与运营约束的同时最大化长期学习效果。尽管大语言模型(LLM)为自由形式推荐提供丰富的语义理解,把它应用于长程 LPR 充满挑战,原因包括:(i) 在稀疏且延迟的反馈下与最近发展区(ZPD)等教学目标错位;(ii) 专家示范稀缺且昂贵;(iii) 学习效果、难度调度、长度可控性与轨迹多样性之间的多目标交互。为解决这些问题,我们提出 IB-GRPO(Indicator-Based Group Relative Policy Optimization),一个面向基于 LLM 的 LPR 的指标引导对齐方法。为缓解数据稀缺,我们通过遗传算法搜索与教师 RL 智能体构建混合专家示范,并用监督微调对 LLM 热启动。在这一热启动基础上,我们为难度调度设计会话内 ZPD 对齐分数。IB-GRPO 随后使用 Iε+ 支配指标在多个目标上计算群组相对优势,避免人工标量化并改善 Pareto 权衡。在使用 Qwen2.5-7B 主干的 KES 模拟器上,在 ASSIST09 与 Junyi 上的实验相对代表性 RL 与 LLM 基线取得一致改进。
