论文

从轨迹到前缀:通过重播前缀和在线延续重用教师轨迹

From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation

模型训练强化学习

摘要

小语言模型对于交互式代理来说是有吸引力的支柱,但来自强大教师轨迹的直接 蒸馏 通常会将丰富的多轮行为转变为一次性模仿目标。这在长期环境中是低效的,因为早期的决策会影响后来的状态和奖励。我们提出了 Prefix-GRPO,这是一种强化学习框架,可将教师轨迹分解为重放对齐的前缀查询和在线延续。每个前缀都会在环境中重放以恢复有效的中间状态,之后学生继续在线交互并获得任务奖励。与仅响应 GRPO 不同,Prefix-GRPO 还将剪辑的策略更新应用于重播前缀内的历史辅助词元,使用策略提取的 SFT 检查点来估计其旧的对数概率。这将前缀学习和继续学习统一在同一策略优化形式中。 TextCraft、BabyAI 和 ALFWorld 上的实验表明,Prefix-GRPO 在 蒸馏 和标准 RL 基线上改进了小模型代理,而消融表明,如果没有明确的前缀词元优化,仅重放是不够的。实现和复制脚本可在 https://github.com/HappynessI/Prefix_GRPO 获取。