论文
编码基准中扩散语言模型的量化鲁棒性
On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks
摘要
自回归大语言模型(LLM)在编码任务上实现了强大的性能,但会产生较高的内存和推理成本。基于扩散的语言模型 (d-LLM) 通过迭代去噪提供有界推理成本,但它们在 后训练 量化 (PTQ) 下的行为却很少被探索。我们研究了 PTQ 技术,特别是 GPTQ 和改进的 Hessian 感知量化 (HAWQ) 算法在基于扩散的编码 LLM (CoDA) 上的应用和鲁棒性,并观察到,在标准化评估流程下,与自回归对应物 Qwen3-1.7B 相比,应用于 CoDA 的这些方法在低位宽下表现出更高的鲁棒性。我们发现,在我们的设置中,CoDA 在低位宽(2-4 位)下表现出更高的鲁棒性,并且在 HumanEval 和 MBPP 基准测试中精度下降更小。此外,源自 HAWQ 的混合精度配置可在准确性、延迟和内存之间提供平滑的权衡。结果表明,由于更具量化弹性,扩散 LLM 可能为高效部署提供优势。