论文
QuAR:单次前向重校准量化 ViT 的激活分布
Test-Time Adaptation of Quantized ViTs via Single-Pass Quantizer-Aligned Recalibration
摘要
后训练 量化是将视觉变换器 (ViT) 纳入边缘计算和 记忆 预算的标准途径,但量化模型在分布偏移下变得特别脆弱。 测试时适应(TTA)在没有标签的情况下解决了这种转变,但大多数现有方法与量化推理的约束不太一致。流行的 TTA 方法通过反向传播来恢复准确性,而无反向传播的方法通常仍然会因额外的前向传递或参数更新而产生开销,而轻量级的特征或 logit 级别的方法仅恢复部分损失。在这些方法中,放大下降的特定于量化的故障模式并不是直接针对的:在移位下,激活以不同的方式占据冻结量化器的校准范围,从而扭曲其代码分布。我们提出了量化器对齐重新校准(QuAR),这是一种针对量化 ViT 量身定制的单通道 TTA 方法,既不会反向传播,也不会更新任何模型参数。 QuAR 重新校准冻结量化器输入处的激活,将测试流的每通道运行统计数据映射回源校准。在使用 ViT-B 的 ImageNet-C 上,QuAR 在 3 位、4 位、6 位和 8 位权重/激活 精度 下实现了最先进的无反向传播 TTA 方法中的最高平均精度,在 8 位时比最强基线高 2.28 个点,在 3 位时比最强基线高 4.00 个点,延迟降低了 46%,记忆 开销仅为 0.17 MB (峰值推断 记忆 的 0.01%)。分析和诊断跟踪增益以减少这些量化器处的每通道失配,从而恢复基线保持不变或进一步失真的代码分布。单个固定配置在连续流中保持领先,非独立同分布。标签转移、七个未发行套件以及其他三个 骨干模型。