论文
Q-ARVD:量化自回归视频扩散模型
Q-ARVD: Quantizing Autoregressive Video Diffusion Models
摘要
自回归视频扩散模型(ARVD)已成为流视频生成的一种有前景的架构,为实时交互式视频生成和世界建模铺平了道路。尽管 ARVD 具有潜力,但其巨大的推理成本仍然是实际部署的主要障碍,这使得模型量化成为提高效率的自然方向。然而,ARVD 的量化在很大程度上仍未得到探索。我们的实证分析表明,直接将为标准扩散 Transformer 开发的现有量化方案应用于 ARVD 会导致性能次优,从而揭示出与双向扩散模型中观察到的量化行为不同的量化行为。在本文中,我们确定了量化 ARVD 的两个关键挑战:(C1)高度不平衡的逐帧量化灵敏度。自回归生成过程中的误差累积会导致跨帧的量化灵敏度严重偏斜,遵循指数式衰减模式。 (C2) 权重中突出且异质的异常值模式。权重分布表现出明显的离群通道,其模式在层类型和块深度上有很大差异。为了解决这些问题,我们提出了 Q-ARVD,这是一种用于精确 ARVD 量化的新颖框架。 (S1) 为了解决高度不平衡的帧级灵敏度,Q-ARVD 将最终质量感知帧加权机制纳入量化目标。 (S2) 为了防止异构异常值降低性能,Q-ARVD 引入了异常值感知自适应双尺度量化,它自动检测任意层异常值通道的存在和数量,并将它们隔离以保护正常通道。大量实验证明了 Q-ARVD 的优越性。