论文
GRZO:大语言模型 微调 的组相对零阶优化
GRZO: Group-Relative Zeroth-Order Optimization for Large Language Model Fine-Tuning
摘要
零阶 (ZO) 优化是 微调 大语言模型 反向传播的一种内存高效替代方案,但其部署受到梯度估计的高方差的限制。我们提出了 GRZO,一种组相对零阶优化器,它为每个小批量示例绘制一个伪独立扰动,并通过组相对归一化聚合每个示例的损失,将有效梯度方向计数从 1 提高到批量大小,无需额外的前向成本,同时保留推理级内存。我们证明 GRZO 是方向无偏的,方差与批量大小成比例缩小,从而产生比 MeZO 更严格的非凸收敛边界。在 RoBERTa-large、Llama3-8B 和 OPT-13B 的多个任务中,GRZO 比 MeZO 提高了 Llama3-8B 的平均准确度 $+3.0$,峰值 GPU 内存降低了 23\%$;作为 MeZO 核心的直接替代品,它将稀疏、低秩和量化的 ZO 变体平均提升了 $+6.0$。