论文

BWTA:算法-硬件协同设计的准确高效的二值化 Transformer

BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design

摘要

超低位量化为基于 Transformer 的模型带来了可观的效率,但精度下降和有限的 GPU 支持阻碍了其广泛使用。在本文中,我们分析了二值化中的零点失真,并提出了一种二元权重和三元激活(BWTA)量化方案,该方案将微小值投影为零并保留极低位模型的准确性。对于训练,我们提出平滑多级量化,结合水平降级策略和幅度对齐投影因子,以实现稳定和快速的收敛。为了进行推理,我们开发了一个 BWTA MatMul CUDA 内核,具有指令级并行位打包和针对线性和注意力运算符的全面二进制/三元 MatMul 实现,从而允许跨 Transformer 架构无缝集成。实验表明,BWTA 接近 BERT 的全精度性能,在 GLUE 上平均下降 3.5%,在五个任务上下降不到 2%,并且在 LLM 上实现了相当的困惑度和准确性。在效率方面,它在 NVIDIA GPU 上的内核级加速比 FP16 提高了 16 到 24 倍,在 LLM 上实现了 216 到 330 个词元/秒的端到端预填充加速,同时内存占用更低。作为一种算法-硬件协同设计,BWTA 在不牺牲模型质量的情况下展示了实用、低延迟的超低位推理。