论文

超越层:统一多模态模型的位置解决梯度冲突和位置感知调制

Beyond Layers: Position-Resolved Gradient Conflict and Position-Aware Modulation for Unified Multimodal Models

模型训练预训练

摘要

统一多模态模型 (UMM) 在共享参数上训练图像理解和自回归图像生成,并且已知这两个目标会相互干扰。现有的诊断和补救措施是在各层或专家的分辨率下进行的,测量每层的冲突并通过分离参数来解决它。我们认为这个决议隐藏了一个正交轴。 UMM 中的生成是对视觉词元的光栅序列的下一个标记预测,其角色随位置而系统地变化,因此生成梯度对理解的干扰程度应取决于它在序列中的起源位置。我们引入了一种位置解析干扰图,它将理解生成梯度冲突归因于每层内的视觉词元位置,该位置是通过单次反向传递计算得出的,成本为标准反向传递的 1.2 倍。在 Show-o 和 Janus-Pro 上,位置解释了控制深度后的大部分冲突方差(Show-o 上层的部分 $η^2=0.31$ 对比 $0.35$;Janus-Pro 上的 $0.15$ 对比 $0.30$):序列的第一季度的平均梯度余弦为 $-0.18$,而最后一个季度的平均梯度余弦为 $-0.02$。依赖性在每个位置梯度范数归一化后仍然存在,保留其效果大小的 80%$,并且冲突强度跟踪语义内容(Spearman $ρ=0.64$)。在地图的基础上,我们提出了位置感知调制(PAM),它仅在高冲突位置消除生成梯度的反对齐分量,而不改变架构。在匹配的可训练参数预算下,PAM 在 Show-o 上将逐层分离提高了 $+21$ MME 和 $+2.4$ GenEval 点,同时在 POPE 和整体 FID 上进行匹配;随机位置控制可恢复约 31%$ 的增益。基于位置和基于层的分离是互补的自由度并且可以组合。