论文

双胞胎:学习预测具有焦点损失的统一表示

Twins: Learn to Predict Unified Representations with Focal Loss

模型训练预训练

摘要

统一的多模态模型寻求一个支持多模态理解和图像生成的共享视觉标记空间。离散方法通过共享代码本统一接口,而连续管道通常依赖于两种不同的表示——用于理解的语义特征(例如 ViT)和用于合成的底层潜在特征(例如 VAE)——导致潜在空间不匹配。我们提出Twins,通过在同一词元网格上按通道连接ViT和VAE特征形成统一的连续词元空间,因此序列长度不变并且注意力成本不会增加。然而,在扩散 Transformer 中联合建模双胞胎暴露了严重的优化不平衡:该模型很好地拟合了 ViT 组件,但难以匹配 VAE 潜在分布。我们将这种不平衡追溯到异质性的三个来源:频率偏差、内在维度以及条件对齐与条件无关的不确定性。为了解决这个问题,我们采用了流匹配的焦点回归目标,该目标增加了大误差 VAE 维度的权重,更好地平衡了 ViT 和 VAE 组件的优化。在 ImageNet 上,在没有无分类器指导的情况下,与朴素 MSE 损失相比,这会产生高达 10.57 gFID 的增益。 Twins 还在多模态理解基准上表现出竞争力,并提高了重建保真度,缩小了面向理解和面向生成的表示之间的差距。