论文

PHF:自策略自蒸馏的特权隐藏流

PHF: Privileged Hidden Flow for On-Policy Self-Distillation

摘要

自策略自蒸馏(OPSD)通过匹配同样看到经验证参考解的特权教师——在其自身策略采样的rollout上训练推理模型。既有OPSD目标仅监督输出分布——特权上下文经token级散度影响训练——而未直接监督产生该分布的内部计算。我们提出特权隐藏流(PHF)——额外蒸馏特权教师的隐藏态如何沿同一rollout移动。PHF不强制学生隐藏向量逐点匹配同一token位置的教师向量——而是在选定生成位置上对齐token到token的转移方向与轨迹几何。全层配方还包括由这些相同转移计算的相邻层关系——而无需逐点隐藏态模仿。在相同100步训练日程下——PHF在我们复现的OPSD基线上改进Qwen3-1.7B、4B与8B的Average@12聚合——观测增益约+2.2、+1.5与+1.7分。该传输目标对共享轨迹偏移严格不变;其局部几何项对转移方向的正交变换也不变。消融区分PHF固定配方与逐点隐藏态匹配、单通道转移损失及层子集选择——支持PHF作为OPSD的紧凑隐藏流扩展。

PHF:自策略自蒸馏的特权隐藏流:论文配图
图 1:特权隐藏流 (PHF) 概述。在线学生仅从问题中进行了展示。然后,特权 EMA 教师以参考解决方案和相同的推出词元为条件,提供 OPSD 输出分布目标和 PHF 隐藏流目标。 PHF 在每一层匹配标准化标记到标记的隐藏转换及其轨迹几何形状,然后将此局部转换损失与根据相同转换计算的相邻层关系相结合。完整目标将这种隐藏流损失添加到标准 OPSD 输出损失中。特权教师仅在训练期间使用,部署的模型是在线学生。