论文

超越密集 Adam 状态:内存高效优化器的自适应对数空间量化

Beyond Dense Adam States: Adaptive Log-Space Quantization for Memory-Efficient Optimizers

模型训练参数高效训练

摘要

优化器状态量化通常是为 Adam 的密集、参数对齐的一阶矩和二阶矩数组而设计的。这种抽象破坏了内存高效优化器,其状态可以在投影空间中进行因子分解、置信度调制或维护,因此类似的重建误差可以产生不同的更新误差。我们将优化器状态量化表述为表示、拓扑和更新语义的联合问题。然后我们引入非负状态的自适应对数空间(AL)量化。 AL 适合每个块观察到的非零对数区间,并为精确零保留单独的代码,强制 $q = 0 \Leftrightarrow x = 0$;有符号动量和状态精度仍然可以独立选择。受控探针表明,自适应范围减少了更新误差和时间漂移,精确的零保留保留了休眠状态,并且状态拓扑限制了有用的块粒度。端到端语言 - 模型训练 跨密集、因子、置信度和预测优化器状态评估结果策略。在 TinyLlama-1.1B 上,具有统一 8 位动量的 AL8 达到了 72.90 的困惑度,而位和字节 8 位 AdamW 的困惑度为 73.54,具有相当的优化器状态存储和更高的吞吐量。当 CAME 的非负状态使用 AL16 时,CAME 与三个种子的参考级最终困惑度相匹配,而语义分组和保护策略则弥补了大部分量化 Adafactor 的 100K 步后期损失差距。这些结果使状态拓扑和更新语义成为优化器量化的一流设计约束。