论文
通过 同策略 优化和 蒸馏 在 大语言模型 中进行长上下文推理的秘诀
A Recipe for Long-Context Reasoning in Large Language Models via On-Policy Optimization and Distillation
摘要
用于长上下文任务的训练后模型的现有方法面临互补的局限性:(i)有监督的 微调(SFT)提供稳定的监督,但存在暴露偏差; (ii) 强化学习方法,例如组相对策略优化(GRPO),在模型生成的轨迹上进行训练,但与长期贡献分配和稀疏奖励作斗争; (iii) 同策略 蒸馏 (OPD) 提供密集的 词元级 指导,但不直接优化任务奖励。我们研究了这些用于长上下文对齐的补充策略,并得出了将 GRPO 与 OPD 式教师指导相结合的秘诀:学生使用结果级别奖励从自己的部署中学习,而更强大的教师则提供密集的 词元级 正则化来代替标准参考策略。当难以获得过程级监督时,这尤其有用。为了支持这项研究,我们引入了 LongBlocks,这是一个涵盖多跳推理、上下文基础和长格式生成的综合多语言数据集。通过受控消融,我们隔离了冷启动初始化、教师锚定和数据混合的角色,表明我们的方案提供了比 GRPO 或 OPD 更稳定、更有效的长上下文推理路径,同时保留了短上下文功能。