论文
制作模拟训练规模:共同设计映射、优化器和转换器
Making Analog Training Scale: Co-Designing Mapping, Optimizer, and Converters
摘要
模拟内存计算(AIMC)通过直接在存储权重的地方执行矩阵运算,为模型训练提供了另一种选择。然而,由于严重的硬件非理想性,包括具有有限动态范围和写入粒度的物理权重、具有有限分辨率的模数转换器以及噪声和不对称更新,扩展 AIMC 来训练现代深度模型仍然是一个开放的挑战。基于梯度累积对精度和舍入误差敏感的认识,我们采用了混合精度训练范式:在模拟域中执行前向和后向矩阵乘法,同时在数字域中计算权重梯度。为了实现可扩展的训练,我们提出了一种整体系统算法协同设计,可以共同优化权重映射以确保条件良好的物理和逻辑权重配置文件,将预处理优化器与阈值触发的开环脉冲结合起来以稳定训练轨迹,并调整转换器动态范围以抑制量化误差。通过使用电化学 RAM 测量进行校准的硬件校准架构模拟进行评估,我们的框架将 Transformer 训练扩展到 $123M$ 参数,验证损失缩放为 $L\propto N^{-0.231}$,其中 $N$ 是参数计数,与数字训练的 $L\propto N^{-0.238}$ 相当。