论文

按位流长度调整精度,探索视觉模型的随机计算量化

Precision As You Need: Stochastic Computing Is a Dense Adaptive Quantizer

摘要

矩阵乘法在现代基于 Transformer 的视觉模型的推理成本中占主导地位,但现有的效率技术(例如训练后量化和混合精度推理)在很大程度上仅限于传统加速器支持的一小组固定宽度格式(INT4、INT8、BF16 和 FP16)。我们重新审视随机计算(SC),将其作为解除这一限制的一种方法:被视为密集自适应量化器,SC 通过位流长度 L 而不是固定数据路径来控制精度,而每次乘法都简化为单个 AND/XNOR 门。我们构建了一个 GPU 库,可以大规模模拟 SC 矩阵乘法,将流长度公开为一流的内核参数,并在图像分类、对象检测和实例分割、类条件图像生成和视觉世界模型规划方面对 SC 进行端到端评估。在此基础之上,我们开发了一种动态的每行混合精度策略,该策略以匹配的平均预算为每个词元或组分配流长度,不需要重新训练,并且跨计划使用相同的 SC 硬件。在各种任务中,SC 在匹配的位预算下仍然与固定格式 INT 量化具有竞争力,而每行混合精度有助于在较低的平均流长度下保持准确性。这些结果提供了软件级可行性证据,表明 SC 可以作为现代视觉Transformer上细粒度混合精度推理的密集精度基底。