论文
相信方向,搜索步长:LLM微调的零阶和一阶方法
Trust the Direction, Search the Step: Zero-and-First-Order Methods for LLM Fine-Tuning
摘要
步长选择仍然是大规模神经网络优化的核心挑战;保守的步骤会减缓收敛速度,而激进的步骤则会破坏收敛的稳定性。我们结合 Zero-and-First-Order optimization~(ZFO) 并提出了一个轻量级框架,将方向选择与步长解耦。 ZFO 使用可信的一阶优化器来确定方向,并仅沿着该一维子空间执行零阶评估以选择移动多远。使用当前的{梯度信息}和两个附加的目标函数评估,ZFO 实例沿着建议的方向构建目标函数的局部模型,并在有界搜索间隔内选择曲率感知步骤。这产生了一种自适应步长选择机制,其成本低于完整线搜索。我们提供理论保证来表明共享样本评估产生可靠的有限差分曲率估计,诱导的局部模型沿着搜索区间选择接近最优的步骤,并且 ZFO 收敛到驻点的邻域。在评估的设置、语言模型和数据集中,相对于固定步长一阶基线,ZFO 经常改进优化和最终性能,其幅度和首选局部模型取决于目标。我们的代码公开于:https://github.com/nizswan/Zeroth-First-Order-Framework.