论文
语言条件反量化:恢复量化从非英语语言中窃取的东西
Language-Conditional Dequantization: Recovering What Quantization Steals from Non-English Languages
摘要
激进的量化会不成比例地损害多语言能力:在 sub-4B INT3 GPTQ 体系中,我们测量到非英语语言的困惑度降级是英语的 2-4 倍。我们提出了语言条件反量化 (LCD),这是一种事后方法,将每种语言的 2 级 LoRA 校正附加到已量化模型的线性层,为每种语言添加 0.12% 的参数,并在单个 GPU 上进行不到 20 分钟的训练。在 Qwen2.5-3B 和 Llama-3.2-3B 中,LCD 恢复了非拉丁脚本语言的 70-83% 的困惑度差距和 GlobalMMLU 准确率差距的 17-28%,在类型上相距较远的语言和无数据的低秩基线 (LQER) 上比语言不可知的同等容量校正高出 3-9 个点,超出一个数量级。我们进一步确定了困惑度与准确性之间的脱节,并将其追溯到量化集中损害的地方:早期深度误差(Llama)向下游传播并抵抗局部校正,而晚期深度误差(Qwen)则不会。 LCD 的层限制变体直接验证了该机制。