论文
具有观察校准自我的代理强化学习蒸馏
Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation
摘要
大语言模型 代理通常通过具有稀疏轨迹级奖励的强化学习进行训练,这对于单个词元的更新强度提供了有限的指导。 同策略 自蒸馏 (OPSD) 通过在特权重播视图下重新评分生成的词元来解决此问题,以获得密集的 词元级 监督。然而,我们发现了一个令人困惑的问题:所得到的支持可能反映了重播视图中包含的特权信息和重播支架引起的分数变化,使得很难将支持专门归因于该信息。当未来的环境观察结果作为特权信息时,这个问题尤其明显,因为重放它们需要重建一个扩展的支架,而该支架本身会扰乱词元分数。为了解决这种混淆,我们提出了观察校准自蒸馏(OCSD),它对比了两种结构匹配的重放视图,完整的和观察消除的,仅在实际的未来观察是否存在方面不同,以得出观察残差,以折扣重放支架共享的分数变化。然后,OCSD 应用此残差以高不确定性步骤调制 词元级 GRPO 更新,同时保留轨迹级更新方向。在 ALFWorld、WebShop 和 Search-QA 上跨三个 Qwen3 模型规模的实验表明,OCSD 始终优于强大的基线。诊断分析进一步证实校准残差与当地环境反馈更好地一致。我们的代码可在 https://github.com/yiy1x/OCSD 上公开获取。