论文
近确定性结构化输出的同策略蒸馏存在外推失效边界
The Extrapolation Cliff in On-Policy Distillation of Near-Deterministic Structured Outputs
摘要
同策略蒸馏 OPD 广泛用于 LLM 后训练。奖励外推系数 λ>1 时,学生可在域内超越教师,但超过阈值 λ* 后,同样的更新会破坏结构化输出任务的格式约束。在单位置伯努利简化模型中,论文推导相对基础模型的闭式裁剪安全阈值 λ*(p,b,c),由教师最高概率、热启动概率质量和重要性采样裁剪强度三个可测量量决定。超过阈值后,外推固定点离开裁剪安全区域,训练由保持格式转为格式崩溃。研究将规则扩展到经校准的 K 元列表式 JSON 任务,条件是单一绑定等价类主导输出约束,且 SFT 留有解析有效性的余量。在 Amazon Fashion 上,三个预注册测试——细网格失效区间、延长预算测试和小裁剪强度交叉预测——均落入预先锁定的预测窗口,小裁剪值与闭式预测的误差小于网格分辨率。运行在阈值略低处时,ListOPD 使1.7B Qwen3 学生以五分之一参数量达到8B SFT 基线的域内表现。收益主要来自格式遵循:成功解析输出的 NDCG@1 随 λ 基本不变,而解析有效性在预测边界处急剧变化。失效边界诊断不依赖评分准则;与基线持平的结果使用 Gemini 评分准则,因此也受该评估器可能接触相关数据的影响。