论文
用于 后训练 大语言模型 量化的硬件感知、每层方法
A Hardware-Aware, Per-Layer Methodology for Post-Training Quantization of Large Language Models
摘要
缩放外积 (SOP) 是一种针对 大语言模型 权重的 后训练 量化方法,旨在通过每层 LUT 解码在硬件上以每个权重 4.5--6 位提供近乎无损的保真度。该方法结合了由每块选择位选择的固定和动态码本对的每层搜索、带符号的每块尺度、激活加权余弦选择以及具有离群值和稀疏残差校正的敏感层的多选背包提升。固定码本包括NF4、BOF4、Split87、SH4;每层优化码本 (DD4) 托管在 LUT SRAM 中。提出了一种新的硬件高效 LUT 输出格式 (HIF),以提高性能、能源和成本。在六个开放模型系列中,推荐的 FP6 操作点(E2M3sUE4M4,6.5 bpw)实现了比传统的每层 POT FP8 基线(E4M3,8.0 bpw)更低的权重重建误差,存储成本降低了 1.5 bpw,这表明具有精心选择的尺度精度的块尺度小原子可以取代传统部署的 FP8。配套论文中报告了 4.5--6 bpw 范围内的全面评估,包括层提升和稀疏残差校正。