论文

ScalePredictor:用于准确量化视觉的实例感知尺度学习 Transformer

ScalePredictor: Instance-aware Scale Learning for Accurate Quantization of Vision Transformers

摘要

Vision Transformer 在许多领域取得了显着的成功,但由于其大量的计算需求,它们在边缘设备上的部署仍然具有挑战性。 后训练 量化 (PTQ) 通过使用小型校准集以最小的训练开销压缩模型,提供了一种有吸引力的解决方案。然而,大多数现有的 PTQ 作品采用静态量化范式,统一应用于所有实例。鉴于自然图像的巨大多样性,样本之间的激活分布差异很大,使得这些方法本质上不是最优的。在本文中,我们提出了 ScalePredictor,一种动态量化框架,用于准确高效地学习 ViT 的量化尺度。我们首先揭示浅层激活的分布范围与深层最佳尺度之间的隐藏相关性。基于此,我们开发了一种尺度学习机制,该机制集成了有效的范围提取方法来捕获浅层阶段的鲁棒范围统计数据,然后将其输入泰勒驱动的多项式尺度投影模块以同时生成所有量化尺度。凭借多项式逼近的效率,ScalePredictor 引入的计算开销微乎其微,同时避免了昂贵的即时校准。 ImageNet 上的大量实验表明,ScalePredictor 始终优于先前的 PTQ 方法,实现了更有利的准确性与效率权衡。代码和其他结果显示在补充材料中。