论文

量化感知修复:恢复压缩 4 位 LLM 的实用方法

Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs

摘要

越来越便宜地提供 大语言模型 意味着交付模型在结构上压缩到其参数的一小部分并量化到 4 位。这些步骤共同降低了推理、数学、编码和长上下文行为的程度,以至于需要在部署之前进行恢复或修复阶段。默认的方法是量化感知训练(QAT),将压缩的量化模型重新拟合到硬标签;在我们的管道中,它慢慢收敛,并在超过峰值后崩溃。我们采用了量化感知修复(QAH)。由于结构压缩模型从未以全精度进行独立训练,因此其 bfloat16 检查点是原始 蒸馏 恢复的近似值; QAH 直接从原始的未压缩模型中提取 4 位学生。在 GPT-OSS 120B 到 60B 到 MXFP4 管道上,QAH 学生在 9 个基准测试中的 7 个上匹配或击败了 bfloat16 源,权重内存减少了大约 4 倍,参数数量减少了教师的一半,并作为 Hypernova-60B 公开发布。与匹配的 QAT 基线相比,它达到峰值的速度大约是 7 倍,并且在持续训练下保持稳定,无需手动调整提前停止。我们还报告了部署经验教训,包括分布式训练后端之间存在巨大的、可重复的质量差距。我们的目标是无需进行数周的超参数搜索即可部署配方。