论文

OPRD:同策略 表示 蒸馏

OPRD: On-Policy Representation Distillation

摘要

同策略 蒸馏 (OPD) 通过匹配下一个词元分布在输出空间中专门监督学生。这种范式有两个局限性:(i) 高方差梯度估计器,其信噪比随着学生接近教师而崩溃;(ii) LM 头信息瓶颈,丢弃教师的中间隐藏状态。我们提出了 同策略 表示 蒸馏 (OPRD),这是第一种将 同策略 蒸馏 提升到隐藏状态空间的方法。 OPRD 在相同的 同策略 采样轨迹上跨选定层对齐学生和教师表示,提供密集、确定性的每层监督,同时完全绕过 LM 头。理论上,OPRD 提供了确定性的每样本梯度,消除了困扰 OPD 的 词元级 估计方差,并公开了任何输出空间目标必然丢弃的结构信息。根据经验,OPRD 缩小了学生与教师在竞赛数学基准(AIME 2024、AIME 2025 和 AIMO)上的差距,其中每个输出空间基线都低于教师,同时训练速度提高了 1.44 倍,内存使用量减少了 54%。我们通过 OPRD-Bridge 进一步将 OPRD 扩展到跨架构设置。通过利用异构模型共享低秩表示结构的观察结果,我们构建了一个冻结投影仪对,该投影仪对在任意深度和宽度不匹配的情况下对齐表示,将对齐从输出空间(取决于共享词汇表)转移到表示空间。我们在跨架构(Qwen3-4B -> Qwen3-1.7B-Base)和交叉分词器(Phi-4-mini-reasoning -> Qwen3-1.7B-Base)设置上验证了 OPRD-Bridge,即使在基于词汇的对齐通道不可用时,也证明了成功的知识迁移。代码:https://github.com/ShenzhiYang2000/OPRD。