论文

AMR-SD:用于token级贡献归因的非对称元反思自蒸馏

AMR-SD: Asymmetric Meta-Reflective Self-Distillation for Token-Level Credit Assignment

模型训练强化学习奖励建模与过程监督RLVRAgentic RL

摘要

大语言模型(LLM)面向复杂推理的对齐严重依赖于可验证奖励强化学习(RLVR)。然而,GRPO等标准算法将序列级奖励均匀地施加到所有token上,造成严重的贡献归因瓶颈。同策略自蒸馏试图通过让自教师以特权上下文为条件来解决这一问题,但直接暴露于原始标准答案往往会导致过度条件化的教师分布、隐式答案泄露以及训练后期崩溃。为克服这些局限,我们提出非对称元反思自蒸馏(AMR-SD)。AMR-SD不再直接以原始参考轨迹为条件,而是插入一个反思瓶颈:它将来自验证器结果、同伴采样或参考反馈的诊断信号压缩为简洁的、自生成的苏格拉底式提示与批评。此外,我们引入带非对称ReLU门控阈值的因果信息增益(CIG),将这些反思转化为稀疏且高度精确的token级优势调制。结合时间退火,该机制在保留基础环境奖励的同时过滤掉分布噪声。在科学、数学和工具使用基准上的实验表明,AMR-SD显著优于现有基线,实现了稳健的长期稳定性并成功防止了训练后期崩溃。

AMR-SD:用于token级信用分配的非对称元反思自蒸馏:论文配图
图 4:非零 CIG 值的经验分布。显着的左偏(峰值略低于零)是由教师对特权信息的调节造成的。这种内在的不对称性需要微分缩放系数(λ>γ\lambda>\gamma)来平衡惩罚和奖励。