论文

PCSD:Agentic强化学习中自蒸馏的持续一致性

PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning

模型训练强化学习RLVRAgentic RL

摘要

大规模语言模型代理在复杂的交互任务中展示了强大的潜力,但其强化学习(RL)通常受到稀疏奖励的阻碍,因为长多轮轨迹仅能接收到单一结果级别的信号。基于代理的自蒸馏(OPSD)提供了从特权教师处的密集词级监督,但教师在每个位置可能不可靠。现有方法通常依赖于孤立的词级差异,这些差异可能敏感于噪声,或者分配共享步级权重,可能忽略位置差异。我们提出持续一致性自蒸馏(PCSD),从教师偏好的信号的局部持久性中提取词级监督权重。PCSD结合了适应性窗口与指数衰减的聚合,以捕捉持续的相对教师支持,应用趋势感知调节以减少局部下降的支持,并通过sigmoid门控产生连续的权重。最终的目标是在与GRPO联合优化时,同时结合密集的教师指导和稀疏的环境反馈。在没有推理时间技能的情况下,PCSD在所有基准中在两个基础架构上取得了最佳的ALFWorld整体结果,两个骨干上分别比GRPO高15.6和13.3个百分点,比SDAR高6.2和5.5个百分点,同时在WebShop上保持竞争力,但在未见过的ALFWorld分割上超越GRPO 15.8个点。

PCSD:Agentic强化学习中自蒸馏的持续一致性:论文配图
图1 :整体性能比较。使用Qwen2.5-3B-Instruct在WebShop和ALFWorld上的主要结果。左: WebShop得分和Acc ;中: ALFWorld子任务雷达;右: ALFWorld总体成功率。