论文

知识蒸馏 的几何极限:基于叠加理论的最小宽度定理

Geometric Limits of Knowledge Distillation: A Minimum-Width Theorem via Superposition Theory

摘要

知识蒸馏 将大型教师压缩为较小的学生,但在整个训练方法和目标中持续存在的损失底线下,表现达到饱和。我们认为这个层是几何的:神经网络通过叠加表示的特征远多于维度,宽度为 $d_S$ 的学生最多可以编码 $d_S \cdot g(α)$ 特征,其中 $g(α) = 1/((1-α)\ln\frac{1}{1-α})$ 是稀疏性相关的容量函数。超出此预算的功能将永久丢失,从而产生重要性加权的损失下限。我们在玩具模型(48 个配置,中值精度 >93%)和 Pythia-410M 上进行验证,其中稀疏自动编码器在 $α\approx 0.992$ 处测量 $F \approx 28{,}700$ 个特征(临界宽度 $d_S^* \approx 1{,}065$)。 蒸馏 分为五个学生宽度,证实了预测的单调楼层排序。观察到的地板分解为几何组件和与宽度无关的建筑基线($R^2 = 0.993$)。线性探测表明,即使 88% 的特征丢失,粗略的概念也能幸存下来,这表明底层是由重要性分布长尾中细粒度特征的聚合丢失引起的。我们的结果将表示几何与 蒸馏 限制联系起来,并提供了一个实用工具,用于仅根据 SAE 测量来预测 蒸馏 性能。