论文

Pareto LoRA:通过帕累托最优梯度积分缓解统一多模态模型中的模态不平衡

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration

模型训练监督微调与指令调优

摘要

统一多模态模型 (UMM) 最近已成为在单个自回归 Transformer 中集成多模态理解和生成的有前途的范例。然而,在多模态指令调整过程中,这些模型经常表现出明显的模态不平衡:语言梯度主导优化,从而导致图像生成质量较低,尤其是在 LoRA 等参数高效的 微调 下。在这项工作中,我们系统地分析了基于 LoRA 的 UMM 微调 中用于交错文本图像生成的模态不平衡。我们表明,与单模态性能相比,视觉模态性能的下降幅度远大于文本模态性能,并且特定模态的梯度在不同任务和层之间可能存在数量级的差异。受这一观察的启发,我们将多模态指令调整重新表述为双目标优化问题,并提出 Pareto LoRA,这是一种 Pareto 最优梯度集成策略,通过调节梯度方向和强度来平衡文本和图像目标。使用 Emu2 在 CoMM 基准上进行的实验表明,Pareto LoRA 持续改善了多模式生成平衡,与普通 LoRA 相比,感知图像质量提高了 44.9%,同时保持了可比较的文本性能。