论文

LocalProp:神经本地化记忆高效反向传播

LocalProp: Neuro-Localized Memory-Efficient Backpropagation

模型训练预训练

摘要

当前的深度学习训练范式采用端到端反向传播,无论训练阶段如何,即预训练或微调。然而,通过整个模型进行反向传播既不符合生物学合理性,也不具有记忆效率,因为大脑内部的学习是高度局部化的。因此,我们提出了 LocalProp,一种本地更新模型权重的训练过程。我们的神经局部权重更新遵循“预训练然后微调”范例,其中预训练基于 I-JEPA。在本地更新权重后,执行剪枝操作,然后是简短的最终微调阶段。剪枝有助于将学习信号从较高的块发送到较低的块。我们对多个数据集(包括 ImageNet 等大规模基准测试)进行了实验,并根据经验表明 LocalProp 只需 GPU 峰值内存的一小部分即可达到良好的性能。通过改变联合优化块的数量,我们将梯度传播跨度确定为对精度与内存权衡的实际控制。