论文

QuantiBias:LLM 中量化引起的偏差的基准测试

QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

几乎每个面向广大受众的 大语言模型 都经过量化:经过完全精确的训练,然后进行压缩以提高效率。此步骤被认为是无害的,并且很少重新检查其安全性。我们发现它的主要副作用是标准安全性评估遗漏的偏差增加。在固定模型、训练和提示的情况下,量化模型仍然会拒绝有害的请求,仍然避免过度拒绝良性提示,并且仍然选择无偏的多项选择答案。然而,当提出一个开放式问题时,同一模型志愿者用我们探索的所有八种语言表达了刻板印象,在独立法官的开放式回答中大约有四分之一(压缩阶梯上的约 24% 至约 27%):它通过了每一项标准检查,但仍然让用户看到了明显更加偏见的情况。选择性缺口是一个强有力的发现;开放式偏差是否会随着压缩而进一步增加还不太确定,这对评分的判断很敏感。我们用 \textbf{QuantiBias} 来解决这两个问题,这是一个基准,它将生成的多语言刻板印象探针与隔离开放式生成的拒绝和多项选择控件配对,比较每个构建是否有推理,并评估其生成的内容严重性。在两个骨干模型(Qwen 和 Gemma)、五个家庭屏幕和八个基准测试中,量化器通过不携带偏差预防信号的能力数据来分配额外的精度,并且在回答之前进行推理,对某些家庭的影响大约减半,而对其他家庭则不做任何事情。必须重新评估量化构建的开放式偏差,而不仅仅是对其已经通过的简短形式的保护措施进行评估。