论文

用于视觉状态空间二元性的通道明智和词元感知的训练后量化

Channel-Wise and Token-Aware Post-Training Quantization for Visual State Space Duality

摘要

状态空间模型 (SSM),特别是 Mamba,已成为基于注意力的架构的有效替代方案,并通过 ViM、VMamba 和视觉状态空间二元性 (VSSD) 扩展到视觉领域。然而,VSSD 的低位训练后量化 (PTQ) 行为仍然没有得到充分理解。 VSSD-Tiny 上的权重激活分割将激活量化识别为主要的低位瓶颈,而所选 VSSD 骨干线性层的代表性输入表现出强烈的通道幅度变化和词元局部极值。我们提出了通道明智的词元平衡输出感知裁剪(CTOAC)方法,该方法通过最小化相应线性输出上的词元平衡重建损失来学习每个输入通道的裁剪边界。仅对选定的线性层及其输入激活进行量化;其他骨干操作保留其原始精度。在 VSSD-Tiny、VSSD-Small 和 VSSD-Base 中,所提出的 CTOAC 方法保留了 ImageNet-1K 的准确性,并且在更激进的精度设置下比评估的基线更加稳健。对 COCO 和 ADE20K 上的 VSSD 主干应用相同的量化范围可以保留强大的对象检测、实例分割和语义分割性能。经过优化的 RTX 4090 部署配置可实现比 FP32 高达 1.42 倍的端到端加速。