论文

NaRA:面向扩散 LLM 参数高效微调的噪声感知 LoRA

NaRA: Noise-Aware LoRA for Parameter-Efficient Fine-Tuning of Diffusion LLMs

模型训练参数高效训练

摘要

扩散大语言模型(dLLM)已成为一种有前景的非自回归生成范式。鉴于全量微调的计算成本难以承受,参数高效微调(PEFT)已成为标准做法。然而,现有 PEFT 方法(如 LoRA)最初是为自回归模型量身定制的,依赖与噪声水平无关的静态参数。因此,它们忽略了扩散过程的内在动态——在去噪轨迹上,输入分布与生成难度会发生显著变化——这使其对 dLLM 而言并非最优。为解决这一问题,我们提出噪声感知低秩适配(Noise-aware Low-Rank Adaptation, NaRA),它引入一个由以噪声水平为条件的轻量级全局共享超网络生成的低秩核心矩阵。这一设计使更新矩阵能够沿扩散过程连续变化,同时将参数与延迟开销保持在可忽略的水平。我们为所提出的 NaRA 框架提供了理论论证,并在常识推理、数学推理与代码生成基准上通过实验展示了其相对噪声不可知基线的一致改进。我们的代码已发布于 https://github.com/generaldi/NaRA。

NaRA:面向扩散 LLM 参数高效微调的噪声感知 LoRA:论文配图
图 2:NaRA 中的架构图示。该框架根据噪声水平 λ\lambda 动态调整权重更新。给定生成过程中每个去噪步骤的噪声水平 λ\lambda,超网络生成动态核心矩阵 𝐂⁡(λ)\mathbf{C}(\lambda),然后将其集成到低秩结构中,夹在静态投影矩阵 𝐁\mathbf{B} 和 𝐀\mathbf{A} 之间。