论文

量化语言模型的行为能力证书

Behavioral Capacity Certificates for Quantized Language Models

摘要

激活和键值缓存精度会改变量化语言模型的计算内容,而不会改变其存储的权重。然而,直接权重代码界限为行为不同的部署分配相同的复杂性,并对行为相同的权重代码单独收费。行为容量证书 (BCC) 使用完整实现的先前总量(权重、比例、激活和缓存规则)对行为进行收费,这些行为会导致相同的有限损失。当量化合并实现时,这种共享质量降低了复杂性损失,并且盈亏平衡法则决定了节省的成本何时能够超过验证成本。 BCC 支持三步部署工作流程,我们的实验验证了每个步骤。首先,仅前向屏幕根据候选扰动保留参考预测的频率来列出每层位宽,其质量可与 Hessian 引导选择相媲美,且预处理成本较低。其次,经过边际认证的单元格识别可以在不改变部署行为的情况下修剪或符号翻转的权重:每个允许的组合都保留所有声明的预测,并且在 OLMoE-1B-7B 和 SmolLM2-1.7B 上,独立探针限制了任何允许的组合更改新文本预测的概率。第三,BCC 限制了已部署模型的总体损失,对于完整的解码器来说是非空的,并且比压缩代码路线更严格。在相同的缓存内存下,为键提供比值更高的精度会在 GPT-2、Qwen2.5 和 SmolLM2 上产生更低的 NLL 和更高的预测一致性,以及 GPT-2 审核中更严格的复杂性界限。