论文

余弦相似度不是充分证据:量化后可解释性迁移的噪声底线

Cosine Similarity Is Not Evidence: Measuring the Noise Floor of Interpretability Transfer Under Quantization

模型评测评测方法与指标

摘要

没有给出解释某个统计量所必需的量,该统计量便不足以构成证据。本文在 AI 安全的一项具体实践中展开这一观点:可解释性产物在全精度权重上校准,却部署到量化权重上,研究者用余弦相似度、相关性、AUROC 等尺度不变量证明其在变化后仍然有效,却未报告噪声底线。对于均值差方向估计器,分半估计的噪声底线由无量纲量 κ=nρ²/d 决定。近似式 E[cos]≈(1+4/κ)⁻¹ 是经典结果,缺失的输入是类别分离度 ρ;作者在真实激活上测量了它,并指出尚未见压缩迁移研究报告该量。在 Qwen2.5-1.5B-Instruct 各层,ρ 为 33—61,因此仅采样因素就会让两次独立估计达到 0.978—0.994 的一致度。已有研究报告全精度与量化拒绝方向的余弦值 0.996,但没有样本量 n,不能据此认定保持不变。在 n 已知时,本文将每个低比特余弦值与相应量化模型内部测得的分半零假设比较;使用全精度基线会假设低比特估计器方差相同,而这正是基线应检验的问题。结果表明,INT4 方向发生旋转,差异超过估计器自身噪声;INT8 未检出移动,但这不是等价结论。尺度不变量还无法区分迁移决策变量的平移与衰减,尽管两者需要相反补救。论文提出只需一次前向传播的报告建议,并公开代码、数据及单单元复现。 资源链接:https://github.com/pvarshh/quantinterp。