论文

Dominant-Layer ZO:单层主导LLM的零阶微调

Dominant-Layer ZO: A Single Layer Dominates Zeroth-Order Fine-Tuning of LLMs

模型训练参数高效训练

摘要

零阶 (ZO) 优化仅使用前向传递即可实现 大语言模型 (LLM) 的内存高效 微调,但目前尚不清楚有用的适应如何跨层分布。在这项工作中,我们揭示了一个令人惊讶的现象:ZO 微调 明显受到单个解码层的支配。在多个 LLM 系列和下游任务中,微调 这一主导层始终匹配甚至超过全模型 ZO 微调。我们进一步表明,主导层与任务无关但特定于模型,并且可以在训练之前通过对激活异常值进行简单的仅推理分析来识别。具体来说,主导层与预训练模型中的第一个激活离群层一致。为了解释这一现象,我们分析了 ZO 优化下扰动效应如何传播。我们发现主导层结合了两个关键属性:高扰动敏感性和残差流中的早期放置,允许扰动引起的效应通过剩余的后续解码层传播和累积。因此,该层在仅前向更新下产生异常强烈且稳定的优化信号。在 LLaMA2-7B 和 Qwen3-8B 上跨九个基准测试的广泛实验表明,主导层 ZO 微调 比全模型 MeZO 和基于 LoRA 的 ZO 微调 提高了平均性能,同时实现了高达 4.52$\times$ 的训练加速。