论文
Ortho-Hydra:DiT LoRA 的正交化专家
Ortho-Hydra: Orthogonalized Experts for DiT LoRA
摘要
多风格数据上的扩散 Transformer (DiT) 的 LoRA 微调 遭受 \emph{风格出血} 的影响:单个低秩残差无法代表多个不同的艺术家指纹,并且优化器收敛到它们的平均值。 HydraLoRA 风格中的专家混合 LoRA 在路由器下用 $E$ 头替换了上投影,但是当每个专家都零初始化时,路由器从每个头接收相同的梯度并保持统一的先验。然后,专家们对称地进行排列,并且网络以 $E{\times}$ 成本训练为单秩 $r$ LoRA。我们提出了 \textbf{Ortho-Hydra},一种重新参数化,它将 OFT 风格的凯莱正交共享基础与从预训练权重的顶部 $(Er)$ 左奇异向量中雕刻出来的每个专家 \emph{不相交输出子空间} 相结合。不相交使得路由器的每个专家分数在步骤~$0$处不会退化,因此专业化在任何专家训练之前就接收到梯度信号。我们通过比较两个 HydraLoRA 基线(零初始化共享基础变体和原始 $σ{=}0.1$ 高斯抖动缓解)与匹配优化器、数据集和步骤预算下的 Ortho-Hydra 来测试 DiT 管道上的预测死锁。两个基线都没有在第一个 $1\text{k}$ 步骤内留下均匀先验; Ortho-Hydra 在最初的几百年内开始去均匀化。多风格数据的最终任务生成质量超出范围;我们报告了结构、冷启动机制以及它改变的路由动态。代码:https://github.com/sorryhyun/anima_lora。