论文
语言模型中量化触发的后门:跨量化器可转移性和验证-部署差距
Quantization-Triggered Backdoors in Language Models: Cross-Quantizer Transferability and the Validation--Deployment Gap
摘要
后训练 量化通常被视为针对 大语言模型 边缘部署的语义中性优化。当评估全精度源检查点并在下游应用量化而无需进行等效重新评估时,此工作流程会产生结构验证部署差距:因为量化是参数空间上的多对一映射,所以源精度认证不能保证已部署配置中的行为等效性。我们通过量化行为等价类(QBEC)形式化了这一差距,并证明 QBEC 成员资格并不意味着行为等价,为量化触发的后门攻击提供了理论基础。基于三阶段对抗性 微调 框架,我们将潜在恶意负载嵌入到满足评估中使用的源精度检查的模型中,同时在 INT8 或 4 位压缩时激活有针对性的对抗行为。我们在两种操作动机场景(战术机器翻译和政治内容分析)中评估这种威胁,将之前的工作从仅解码器的因果 LM 扩展到多语言编码器-解码器序列到序列模型。结果表明,后门翻译模型在修复 FP16 时从零测量的敌友腐败转变为量化后高达 85.02% 的反转,并且配对立场分类器在压缩后测量了高达 $Δ\mathrm{Bias}=0.33$ 的意识形态转变。跨量化器可转移性分析进一步表明,攻击持久性因量化方案和模型架构而异,而不是仅由标称位宽决定。这些发现表明,仅源精度审核并不能排除量化触发的行为,并且最终部署的配置必须包含在值得信赖的边缘人工智能的行为认证中。