论文

视觉自回归模型的移位求和量化

Shift-and-Sum Quantization for Visual Autoregressive Models

摘要

后训练 量化 (PTQ) 可以使用少量数据高效部署深度网络。然而,其在视觉自回归模型(VAR)中的应用仍然相对未经探索。我们确定了将 PTQ 应用于 VAR 的两个关键挑战:(i)注意力价值产品中存在较大的重建误差,尤其是在高注意力分数更频繁出现的粗尺度上; (ii) 由于有限的校准数据,码本条目的采样频率与其预测概率之间存在差异。为了应对这些挑战,我们提出了一个专为 VAR 量身定制的 PTQ 框架。首先,我们引入一种移位求和量化方法,该方法通过聚合来自值标记的对称移位副本的量化结果来减少重构误差。其次,我们提出了一种校准数据的重采样策略,将码本条目的采样频率与其预测概率对齐。类条件图像生成、修复、外绘和类条件编辑的实验显示了 VAR 架构的持续改进,为 VAR 的 PTQ 建立了新的技术水平。