论文

质量不是量化下的安全代理

Quality Is Not a Safety Proxy Under Quantization

模型评测安全与风险评测

摘要

量化检查点通常首先通过质量指标进行筛选,然后才进行直接安全测试(如果有的话)。本文在跨越 6 个模型、4 个系列、7 级 GGUF 阶梯和 AWQ/GPTQ INT4 检查点的匹配 51 行矩阵上审核了该快捷方式。在这个矩阵中,捷径失败了:所有 36 个质量安全配对在模型之间分割方向,9 个隐藏危险行加上 1 个近乎隐藏危险行显示质量稳定或有所改善,而拒绝率下降了 12-68 个百分点。 11行AWQ/GPTQ中有7行存在隐患。对 17 个 Hugging Face-backed FP16/AWQ/GPTQ 细胞进行四探针机械跟踪并不能挽救它:熵、拒绝方向和校准探针是危险行的弱或空分隔符,尽管探针识别的安全相关神经元总体上吸收了 1.39$\times$ 的量化误差($p < 5 \times 10^{-7}$),但效果是不针对特定政权。 Claude Sonnet 4 重新标记了预定义分层集中的 11,470 个项目,在 89.9% 的行上与主要 gemma3:12b 判断一致($κ= 0.873$, 95\% CI [0.866, 0.881]),并更改了 0/10 个隐藏危险单元格。校准的研究内部行为屏幕——拒绝模板稳定性指数(RTSI),由四个拒绝模板漂移特征构建并在此矩阵上进行校准——将 10/10 隐藏或接近隐藏危险行路由到直接安全测试(威尔逊 95\% CI 下限 0.72),同时在样本内评分和行级别下将 45 个非基线行中的 23 个留在低风险桶中留一验证;在同一矩阵上,最佳单特征基线(唯一前缀率增量、原始拒绝率增量)在匹配的存储桶大小下分别恢复 9/10 和 8/10,并且跨堆栈传输需要重新校准。对于此处研究的量化检查点、模型系列和安全结果,保留质量不能放弃直接的安全评估。