论文
SCOPE-OPSD:用于策略自蒸馏的费希尔条件特权子空间
SCOPE-OPSD: Fisher-Conditioned Privileged Subspaces for On-Policy Self-Distillation
摘要
按策略自我蒸馏(OPSD)通过解条件自教师对学生生成的前缀进行评分,但仅通过下一个词元概率转移监督。我们询问对齐的最终层差异是否提供了有用的第二通道,以及如何测试该通道而不将其几何形状与辅助强度混淆。 SCOPE-OPSD 将特权师生残差投影到根据残差协方差和语言模型头 Fisher 敏感性估计的冻结的 64 级因子上。它重用了 OPSD 已经要求的转发,并且既不添加 rollouts,也不添加推理时间模块。匹配的随机控制保留结构化因子的等级和非零谱,并使用每臂梯度 RMS 校准,隔离数据相关方向的影响。在 Qwen3-1.7B、4B 和 8B 的完整 25/50/75/100 步骤轨迹中,Structured 永远不会低于 Pure OPSD,在 12 个模型检查点组合中的 11 个中具有严格增益,并且在 4B 步骤 25 中精确平局。在 12 个组合中的 10 个中,Structured 也超过了匹配的 Random。在 Qwen3-1.7B 的第 75 步,在两次独立训练重新运行中,Structured 比匹配的 Random 多出 1.39 Macro Avg@12 点。交叉拟合诊断还显示,保留的特权间隙捕获比匹配的随机方向高 4.40 倍。结果支持针对短预算 OPSD 的紧凑的费希尔条件特权子空间。