QATFactory:一个多功能、部署一致的框架,用于大语言模型的量化感知训练和提炼
QATFactory: A Versatile, Deployment-Aligned Framework for Quantization-aware Training and Distillation of LLMs
摘要
大语言模型 (LLM) 推理越来越倾向于降低精度,以实现硬件加速器的吞吐量,但激进的训练后量化 (PTQ) 会降低模型质量。我们提出了 QATFactory,一个用于部署一致的量化感知蒸馏 (QAD) 和强化学习 (QARL) 的开源框架。 QATFactory 在 BF16 中执行矩阵乘法时模拟部署时量化,使模型能够适应量化噪声,而无需训练本机支持目标格式的硬件;例如,它支持在缺乏 FP4 Tensor Core 的 H100 GPU 上进行 NVFP4 训练。框架支持NVFP4、MXFP4和$llama.cpp$的Q4_K格式;密集模型和混合专家模型;以及全参数和基于 LoRA 的训练。它将检查点直接导出到 vLLM 和 $llama.cpp$,无需额外的有损转换步骤或增加推理开销。借助 QATFactory,我们对 8B 到 230B 参数的模型进行了广泛的实验,并评估生产推理引擎中导出的检查点。跨模型和格式,QAD 在强大的 PTQ 基线上不断提高部署模型的质量。在 Qwen3.5-9B 上,QAD 在 NVFP4 下实现了 68.9% 的平均基准准确度,在 MXFP4 下实现了 66.0% 的平均基准准确度,分别优于 PTQ 的最佳结果 65.4% 和 56.4%。通过我们的实验,我们发现虽然两种 FP4 格式都会在部署时量化权重和激活,但最佳训练策略取决于格式:当训练期间仅量化权重时,NVFP4 通常表现更好,而 MXFP4 从量化权重和激活中受益。在固定的训练词元预算下,对更少的 32K 序列进行训练比对更多 4K 序列进行训练的平均准确度提高了 1.9 个百分点。