论文

DASH:推理模型在策略自蒸馏的分歧自适应监督跨度

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

摘要

使用可验证奖励的强化学习(RLVR)通过自动可验证结果信号提高了大语言模型的推理能力,但这些信号通常是稀疏且在序列级别。针对这一问题,我们提出了自蒸馏方法On-policy Self-Distillation (OPSD),它通过查询特权教师来访问学生访问过的前缀,并提供密集的词级分布性监督。尽管这种密集监督缓解了信号稀疏性,但我们发现标准的OPS D仍然未能充分利用轨迹中的时间结构。它为每种局部差异赋予相同的系数,无论其位置还是差异序列在其中发生。在On-policy自回归生成中,同一种差异大小可以跟随不同的差异历史,反映教师和学生之间的不匹配演变。由于局部标量无法区分这些时间上下文,因此标准的OPS D无法根据生成过程中局部差异的变化来调整词级权重。为了解决这一限制,我们提出了Divergence-Adaptive Supervision Horizons (DASH)。DASH将每个局部校准信号与序列均值之间的差距映射到可调传播门,并然后使用这些门控制后退多步聚合。通过这种方式,DASH根据生成过程中局部差异的变化来调整词级监督权重。在三个数学推理基准上进行的实验结果表明,DASH在所有尺度上都优于我们的匹配标准OPS D重跑。DASH重复使用OPS D已经计算出的学生和教师分布,因此无需额外的教师或学生前向传递。代码:https://github.com/DBtxy/DASH-OPSD

DASH:推理模型在策略自蒸馏的分歧自适应监督跨度:论文配图
图 2:DASH 概述。一位有特权的老师评估学生生成的推出以产生局部蒸馏信号。 DASH 将其序列相关间隙转换为自适应传播门,并应用向后多步聚合来构造时间条件令牌级权重和自适应监督视野。