论文

ARHead:大语言模型 输出头的激活度量残留校正

ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

摘要

仅权重量化大大减少了 大语言模型 (LLM) Transformer 块的存储,但实际后端通常保留 BF16 或 FP16 中的最终语言建模头 (LM-head)。简单地量化此投影会强烈扰乱词汇表 logits 分布。我们提出了 ARHead,一种打包的 LM-head 压缩器,它结合了量化的低秩核心、分组 INT4 残差以及安装在激活派生度量中的低秩校正。 ARHead 不存储密集的 BF16 磁头,并将持久性 LM 磁头存储量减少了 3.7-3.9 倍。在 Qwen3-8B-Base 上,它使用 25.6% 的 BF16 磁头存储,同时获得 1.007 的相对复杂度;存储匹配的朴素 INT4 产生 1.14-1.16。用 AWQ 或 bitsandbytes 替换 BF16 头仅增加 0.006-0.007 交叉熵,在我们的测量中吞吐量变化不到 2%。因此,ARCHead 通过压缩可以保持不变的大输出投影来补充块量化器。代码可在 https://github.com/suayptalha/archead 获取。