论文
PHF:自策略自蒸馏的特权隐藏流
PHF: Privileged Hidden Flow for On-Policy Self-Distillation
摘要
自策略自蒸馏(OPSD)通过匹配同样看到经验证参考解的特权教师——在其自身策略采样的rollout上训练推理模型。既有OPSD目标仅监督输出分布——特权上下文经token级散度影响训练——而未直接监督产生该分布的内部计算。我们提出特权隐藏流(PHF)——额外蒸馏特权教师的隐藏态如何沿同一rollout移动。PHF不强制学生隐藏向量逐点匹配同一token位置的教师向量——而是在选定生成位置上对齐token到token的转移方向与轨迹几何。全层配方还包括由这些相同转移计算的相邻层关系——而无需逐点隐藏态模仿。在相同100步训练日程下——PHF在我们复现的OPSD基线上改进Qwen3-1.7B、4B与8B的Average@12聚合——观测增益约+2.2、+1.5与+1.7分。该传输目标对共享轨迹偏移严格不变;其局部几何项对转移方向的正交变换也不变。消融区分PHF固定配方与逐点隐藏态匹配、单通道转移损失及层子集选择——支持PHF作为OPSD的紧凑隐藏流扩展。
