论文
量化和采样温度对 LLM 安全对准的联合影响:因子分析
The Joint Effect of Quantization and Sampling Temperature on LLM Safety Alignment: A Factorial Analysis
摘要
现代 LLM 部署通常将量化与更高的采样温度相结合,以降低成本、延迟或重复,但安全评估通常将这些视为固定的实现细节。我们测试在 FP16 上使用贪婪解码的安全模型在量化和随机采样后是否仍然安全,或者这两个因素是否会相互放大。我们评估了来自 5 个系列、3 种精度和 6 种温度的 8 个指令调整模型,涵盖 7 个有害性基准的 144 种配置,并生成约 200 万个响应,由六名法官的安全整体进行评分。与低位部署破坏一致性的担忧相反,我们发现标准量化大约是安全中性的:对于 8 个模型中的 7 个,AWQ INT4 将攻击成功率保持在 FP16 的约 1.6 个百分点以内或降低,仅 SmolLM3-3B 的攻击成功率明显下降(34.5% 至 44.1%)。然而,更大的风险来自采样:较高的温度会急剧增加决策的不稳定性,即使平均 ASR 变化不大,DFR 在 T = 1.0 时也达到 41.9%。这两个因素不会复合:我们的复合降解指数仍然是次加性的(-0.071 至 +0.018),表明量化部分抵消而不是放大了温度引起的降解。最后,每个基准的细分表明,单一基准评估严重低估了风险:几个在 AdvBench 上得分为 0% 的模型在 ManyHarm 上得分超过 80%。因此,标准 INT4/INT8 量化对于对齐良好的模型来说是合理的,但安全声明应报告跨多个基准的多样本稳定性,而不是在贪婪解码时依赖单个基准。