论文

通过流匹配中的稀疏矩阵分解进行主时间步限制初始化

Principal-timestep Restricted Init via Sparse Matrix-decomposition in Flow-matching

模型训练参数高效训练

摘要

流量匹配扩散模型最近已成为高保真视觉生成的强大范例。然而,它们过高的微调成本限制了下游任务的可扩展性。虽然低秩适应 (LoRA) 与谱初始化相结合,通过更好地对齐梯度方向,在自回归语言模型中展示了加速收敛并提高了性能,但我们发现它无法在扩散微调方面提供类似的增益,通常会比普通 LoRA 产生边际甚至负面的改进。我们将这种差异归因于 LoRA 的低秩参数化与流匹配目标引起的本质上高秩梯度之间的根本不匹配。特别是,随机时间步采样在训练步骤中引入了方向异质梯度信号,导致低秩约束下的更新不对齐。为了解决这个问题,我们提出了 Prism-LoRA,这是一种通过稀疏矩阵分解框架的主时间步受限初始化,可改善微调期间的梯度对齐。我们的方法由两个关键组成部分组成:(i)主时间步长选择,它将初始化梯度限制为主导时间步长的子集,以抑制有效梯度等级;(ii)主通道过滤,它删除与任务无关的通道,使一步谱初始化梯度能够更好地与长范围优化轨迹保持一致。大量实验表明,我们的方法在多个扩散微调基准上持续提高了收敛速度和最终性能,包括主题驱动生成、可控生成和去模糊,不仅实现了性能改进,而且还实现了比基线 LoRA 和其他频谱初始方法更早阶段的收敛。