论文
STQuant:大型多模态优化器量化的时空自适应框架 模型训练
STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training
摘要
量化是降低大规模模型训练内存成本的有效方法。然而,大多数现有方法采用固定精度策略,忽略了优化器状态分布在层和训练步骤之间存在显着差异的事实。这种统一的设计通常会导致明显的精度下降。为了超越固定量化,我们提出了 STQuant,这是一种分布式训练框架,它通过跨层、状态变量和训练步骤的动态精度分配来减少优化器状态的内存占用,同时保持模型质量。在训练期间单纯地应用动态量化具有挑战性,原因有两个。首先,优化器状态在数值上是敏感的,并且量化噪声会破坏质量的稳定性。其次,共同考虑多个状态和层会产生很大的组合搜索空间。 STQuant 通过两项关键技术应对这些挑战:1)可证明的接近最优的因子选择策略,可以准确识别对精确适应最有影响的因素。 2)动态转换决策算法,将搜索成本从指数复杂度降低到线性复杂度。 GPT-2 和 ViT 上的实验表明,与现有解决方案相比,STQuant 将优化器状态内存减少了 84.4%,平均位宽低至 5.1 位。此外,STQuant 仅产生 O(N/K) 计算开销,并且需要 O(1) 额外空间。