论文

CRAFT:来自已采样兄弟轨迹的反事实贡献分配,用于自蒸馏代理强化学习

CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning

模型训练强化学习

摘要

自蒸馏代理强化学习通过 词元级 蒸馏 损失增强了轨迹级奖励,使用以特权上下文为条件的相同策略作为其老师。流行的方法通过一个标量(师生对数概率差距)来控制这种损失。这个信号受到双重限制:它是回顾性的,只对实际执行轨迹进行评分,而不会对反事实的部署进行评分;而且它是符号盲的,从不发出教师偏好的动作何时会损害轨迹的信号。我们引入了 CRAFT,这是一种解决这两个限制的三支柱贡献分配方案。支柱 1,反事实词元重要性,重用 GRPO 已经采样的 G-1 兄弟执行轨迹,并通过对数概率差距对它们进行重要性加权,以形成对每一步增加教师首选行动权重的群体级反事实优势变化的自我标准化估计;这会以接近于零的额外计算产生带正负符号的逐词元贡献。 Pillar 2 是一个非对称控制器,当它沿着门活动的指数移动平均值降低参考 KL 权重时,它会提高 蒸馏 权重,反之亦然。第三支柱将 KL 惩罚词元逐个极化,根据信用的符号在模式搜索和模式覆盖更新之间切换。每个支柱都有一个独立的开关,禁用时,会使损耗和梯度字节与 IEEE-754 算法中的基线相同,因此任何测量到的增益都可归因于算法更改而不是实现漂移。我们证明了估计器的一致性和方差界限,提供了结构和位精确的再现性保证,并跨三个代理环境、四个模型尺度和五个端到端方法以及两个表格化的先前工作基线评估了 CRAFT。其中包括 Adaptive-CRINGE,它是一个与 CRAFT 共享支柱 2 的比较器,隔离了反事实的贡献。