论文
STaR-Quant:状态时间一致的 后训练 扩散量化 大语言模型
STaR-Quant: State-Time Consistent Post-Training Quantization for Diffusion Large Language Models
摘要
扩散 大语言模型 (DLLM) 最近已成为自回归 LLM 的一种有前景的替代方案,通过双向上下文的迭代屏蔽去噪生成文本。然而,它们的大模型尺寸和迭代去噪过程会带来大量内存和计算开销,从而促进 后训练 量化的高效部署。在本文中,我们确定了低位 DLLM 量化的两个关键挑战:状态相关的激活差异和时间误差累积。屏蔽和未屏蔽的标记在每个去噪步骤中表现出不同的激活分布,而量化误差可以在迭代解码期间跨步骤累积。为了应对这些挑战,我们提出了 STaR-Quant,一种用于 DLLM 的状态时间一致的 PTQ 框架。 STaR-Quant 引入了状态引导激活变换(SGAT),通过统一的静态权重侧变换将屏蔽和未屏蔽的词元分配到不同的激活变换空间。它还引入了时间注意力补偿(TAC),通过轻量级块对角仿射映射来纠正量化注意力表示。对代表性 DLLM 的实验表明,STaR-Quant 在强 PTQ 基线上持续改进低位权重激活量化,同时比 FP16 部署提供高达 1.69 倍的加速和 3.14 倍的内存节省。