论文

零阶优化的学习动态:内核视角

Learning Dynamics of Zeroth-Order Optimization: A Kernel Perspective

模型训练参数高效训练

摘要

经典优化理论认为,零阶 (ZO) 算法会遭受与维度相关的减速,与一阶方法相比,收敛速度通常随模型维度缩放。然而,与这些理论预期相反,最近越来越多的工作证明了 ZO 方法成功应用于具有数十亿个参数的 微调 大语言模型 (LLM)。为了解释这一悖论,我们推导了 ZO SGD 的一步学习动力学,其中经验神经正切核(eNTK)自然地成为控制学习行为的关键术语。对 ZO SGD 生成的 eNTK 的检查表明,每个元素对应于投影到随机低维子空间上的神经正切向量的内积。因此,通过引用 Johnson-Lindenstrauss 引理,我们的分析表明 ZO eNTK 的保真度主要由扰动的数量决定。至关重要的是,近似误差取决于模型输出大小而不是大量参数维度。这种无量纲属性为 ZO 方法到 LLM 微调任务的可扩展性提供了理论依据。我们相信,这个基于内核的框架为在学习动态的背景下理解 ZO 方法提供了一个新颖的视角。