论文

信任还不够:Agentic RL中在线自蒸馏的影响校准

Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL

模型训练强化学习RLVRAgentic RL

摘要

在线自蒸馏(OPSD)让语言智能体从特权自教师在策略自身轨迹上获得密集的token级监督。现有方法主要按教师信任分配这种监督,但信任并不能揭示强调某个token是否支持当前策略目标。我们称其为信任-效用失配,并提出自蒸馏影响校准(ICSD)。对每个受监督token,ICSD测量其重要性加权的RL代理贡献对教师导向输出扰动的一阶响应。批自适应校准将这一非平稳信号转化为有界的分配权重,同时在每个动作回合内保留原始辅助损失质量。这些detach的权重只影响蒸馏损失,不需要额外的模型前向。在ALFWorld、WebShop和Search-QA上,ICSD在GRPO和GiGPO下、跨越1.5B到7B的两个模型家族,所有匹配的汇总指标都优于仅按信任的分配。在7B规模下,它达到96.1%的ALFWorld成功率和93.1的WebShop分数。冻结批分析显示,ICSD将分配给与目标相反token的教师支持质量从60.1%降至37.8%,并将与RL梯度的余弦兼容性提高0.192。配套仓库见 https://github.com/lanqz7766/Influence-Calibration-for-On-Policy-Self-Distillation-in-Agentic-RL。

信任还不够:Agentic RL中在线自蒸馏的影响校准:论文配图
图1:许多现有的 OPSD 分配规则仅凭教师信任度来确定 token 权重。(a) 因此,信任度相同的 token 会获得相同的系数,即便它们对 RL 目标的影响各不相同。(b) ICSD 保留信任信号,并利用客观影响来重新分配同一份辅助质量。