论文

小规模处置 蒸馏:三弧负面结果

Disposition Distillation at Small Scale: A Three-Arc Negative Result

模型训练监督微调与指令调优

摘要

我们着手通过四阶段全麻省理工学院 蒸馏 管道将行为倾向(自我验证、不确定性确认、反馈集成)训练成小语言模型(0.6B 到 2.3B 有效参数),并进行推理时间注意力头干预和冻结基础置信门控 sidecar 的后续实验。一份内部草案报告称,Qwen3-0.6B 学生的 MCAS 得分为 +33.9 分,HumanEval 得分为 +15.3 分;在发布之前,第二次健全性检查伪造了这两个数字。 HumanEval delta 是一个截断伪影 (n_predict=512),在 n_predict=1024 时反转为 -8.0 点;在同等评分下,MCAS 增益消失了。这一伪造引发了随后的三个弧线。在(1)三个模型系列和两个域上的 SFT/DPO LoRA、(2)o_proj 上的推理时间注意头回火以及(3)读取最终词元隐藏状态 h_last 的 无需训练 冻结基础 sidecar 中,我们发现没有任何运算符可以在不损坏内容或陷入风格模仿的情况下移动判断测量的处置。五个型号(Qwen3-0.6B、Qwen3-1.7B、Qwen3.5-0.8B、Gemma 4 E2B 和 SmolLM2-1.7B-Instruct)的故障都是一致的。分布内交叉验证通过(AUC=0.683)在新的提示(AUC=0.516)上崩溃了。我们通过机制贡献了三弧阴性结果、线性 h_last 探针的两种故障模式分类法,以及将我们自己产生的误报类别转换为可发布的阴性结果的诚实伪造管道。作为一项独立发现,Gemma 4 E2B 在 Chef 域上表现出近乎完全的置信正确性解耦(断言不对称性 -0.009;无论正确性如何,模型断言为 91%)。