论文

扩大差距:通过异常值注入利用 LLM 量化

Widening the Gap: Exploiting LLM Quantization via Outlier Injection

模型评测安全与风险评测

摘要

LLM 量化对于内存高效部署至关重要。最近的研究表明,量化方案可能会带来严重的安全风险:对手可能会发布一个模型,该模型在完全精确的情况下看起来是良性的,但一旦被用户量化就会表现出恶意行为。然而,现有的量化条件攻击仅限于相对简单的量化方法,攻击者可以估计在目标量化下保持不变的权重区域。值得注意的是,之前的攻击始终未能破坏更流行和复杂的方案,限制了它们的实际影响。在这项工作中,我们引入了第一个量化条件攻击,该攻击持续诱发恶意行为,这些行为可以由各种高级量化技术(包括 AWQ、GPTQ 和 GGUF I-quants)触发。我们的攻击利用了许多现代量化方法所共有的一个简单属性:大的异常值可能导致其他权重四舍五入为零。因此,通过将异常值注入特定的权重块,攻击者可以在模型中引发有针对性的、可预测的权重崩溃。这种效应可用于制作看似良性的全精度模型,但在量化后却表现出各种恶意行为。通过对三种攻击场景和 LLM 的广泛评估,我们表明,针对先前攻击失败的各种量化方法,我们的攻击取得了很高的成功率。我们的结果首次证明,量化的安全风险不仅限于更简单的方案,而是与复杂、广泛使用的量化方法广泛相关。