论文

压缩下的转向:量化 LLM 中的剂量响应、能力成本和故障不对称性

Steering Under Compression: Dose-Response, Capability Cost, and Failure Asymmetry in Quantized LLMs

模型评测模型行为与机制分析

摘要

推理时间激活控制无需修改参数即可实现 大语言模型 的行为控制,而 后训练 量化可减少部署的内存和计算成本。尽管它们在实践中日益趋同,但这两种技术之间的相互作用仍然没有特征。我们系统地研究了仅权重量化(INT8 和 NF4)下的激活控制,涉及四个开放权重 7-9B 模型和两个行为目标:判断情绪和无判断推理长度。使用等效应框架来比较匹配行为效应的能力成本,我们发现情绪引导在量化中完好无损。使用统一的 v2.3.1 重新评分校正 GSM8K 解析器工件后,合并的 INT8 对比度为 -0.010(90% CI [-0.026, +0.007]),在预先注册的三标签规则下描述性等效,而 NF4 仍然不确定,为 -0.017([-0.067, +0.033])。相比之下,推理长度表现出令人惊讶的不对称剂量反应:延长是分级的,但以帽失控和塌陷终止,而缩短是阶跃函数,在不连续失败之前仅缩短 12-30%(取决于模型)。我们暴露了一个方法论陷阱:幼稚的等效应梯子锚定在倒塌的地板上,以实现地板范围内的目标,并且我们引入了一种可恢复可解释交叉点的审查结构。我们还量化了 Mistral-NF4 的显着基线能力变化(alpha = 0 时 0.545 到 0.365 GSM8K),证明压缩可以主导转向干预。尽管如此,转向向量仍然与其 FP16 兄弟姐妹高度共线(INT8 的余弦相似度为 0.989-0.998,NF4 的余弦相似度为 0.945-0.990),这证实了即使成本结构不能量化,行为方向也能幸存下来。所有代码和数据均已发布。