论文

超越输出匹配:在NVFP4 LLM蒸馏中保留内部几何

Beyond Output Matching: Preserving Internal Geometry in NVFP4 LLM Distillation

摘要

随着大型语言模型越来越多地部署在延迟和成本受限的生产环境中,对低精度推理(包括基于 NVFP4 的方法)的需求不断增长。量化感知蒸馏 (QAD) 通过 KL 散度损失训练量化学生以匹配冻结的更高精度教师的输出分布,从而帮助恢复低位量化下损失的精度。在这项工作中,我们首先提供 QAD 的表示级别诊断:仅输出匹配就可以掩盖内部退化,因为许多中间激活几何形状可以产生类似的教师对齐逻辑。使用 CKA,我们表明仅 KL QAD 可以降低相对于 BF16 教师的分层表示相似性,尤其是 RL 后训练模型中的漂移特别严重。这种漂移与推理和编码任务的下游瓶颈相关,这表明低位恢复需要保留内部几何结构,而不是单独匹配输出。受这一发现的启发,我们提出了 \textbf{CKA-QAD},一种用于 NVFP4 QAD 和低位 LLM 精度恢复的 CKA 引导的表征对齐方法。该方法添加了一个轻量级正则化器,通过 CKA 对齐分层 Gram 矩阵,在蒸馏过程中保留内部表示几何形状。在 Nemotron 3 Nano 和 Qwen3-4B-Thinking-2507 中,CKA-QAD 显着改善了表征对齐,并以适度的训练开销提高了下游推理和编码准确性。我们的研究结果将 CKA 引导的表征对齐定位为量化 LLM 恢复的输出匹配的实用补充。

超越输出匹配:在NVFP4 LLM蒸馏中保留内部几何:论文配图
图 1:Nemotron 3 Nano 的逐层 CKA 比较。标准 QAD(仅限 KL)加剧了中深度层的表征漂移(突出显示),而 CKA-QAD 则恢复了整个网络的对齐。阴影区域表示 Transformer 与 Mamba 块。