量化增强确定性而非偏见:服务时权重压缩的规模相关效应
Quantization Amplifies Determinism, Not Bias: Scale-Dependent Behavioral Effects of Serving-Time Weight Compression
摘要
权重量化在很大程度上决定了为开放权重大语言模型提供服务的经济性。其成本通常通过能力基准来评估,在该基准上,中型模型的 4 位量化通常被认为“几乎免费”。我们研究一个不同的问题:当多个答案都有效时,量化是否会改变模型选择表达的内容?我们以三种重量精度(W4A16 AWQ、W8A16 FP8-Marlin 和 bf16)提供三个检查点(Qwen3-8B/14B/32B),保持硬件、软件和采样配置不变,并通过两个定制的、泄漏检查的提示电池收集约 71,000 个由提示和种子配对的完成情况。我们在版本控制中预先指定了三波分析。在 8B 处,int4 降低了输出多样性:同一场景的两个样本推荐同一品牌的概率增加了 5.1 个百分点(提示配对符号翻转测试,Holm p = .023;在手臂完全再生时以 +4.4pp 重现),词汇多样性大幅下降(TTR -0.011,标准化效应 -0.51;对长度控制测量具有鲁棒性)。在 14B 和 32B 处,没有内容浓度测量达到显着性;相反,出现了风格漂移(em-dash 率在 14B 时为 +0.46/1k 个单词,在 32B 时为 +0.61/1k,Holm p <= .0024)。预先指定的刻板印象方向测试在每个尺度上都是无效的:输出集中于每个提示的模态答案,而不是刻板答案。从机制上讲,Token级别分布变得更平坦(决策Token熵 +0.091 位,p = .015),而直接从第一个Token日志概率测量的语义分布变得更加集中(冲突 +2.6pp,p = .023):即使含义变得更加重复,单个Token也变得更难以预测。在测试的最小尺寸 8B 时,AWQ-int4 服务显着缩小了建议范围;审计应评估集中度和偏差。