论文
镜子:通过格罗莫夫调整从语言到图像的语义关系--Wasserstein
MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein
摘要
多模态 大语言模型 (MLLM) 从其语言主干继承了丰富的关系先验,但当要求在视觉上下文中应用这些关系时常常会失败。我们将这种失败追溯到结构性盲点:基于投影的对齐训练每个视觉标记携带正确的语义,但从不询问概念之间的关系是否能够在从语言到视觉的跨越中幸存下来。为了解决这个问题,我们提出了 MIRROR(通过基于最优传输的正则化将概念间关系从语言映射到视觉表示),这是一种几何正则化框架,通过利用语言表示中编码的丰富关系结构将关系先验从语言转移到视觉。具体来说,我们从提出的半逆 Gromov-Wasserstein (SI-GW) 问题中得出了代理损失,这是一个逆几何问题,它将视觉表示与语言派生的关系先验对齐。我们证明,这个公式承认一个独特的封闭式解决方案,它规定了语言几何和跨模态耦合所隐含的理想视觉关系结构。该公式的结构还可以实现高效计算,使其适用于长词元序列。在仅解码器 Transformer 内部应用 SI-GW 需要仔细设计。我们在层、头和词元级别引入有针对性的策略,以确保稳定提取,而无需额外参数或推理成本。 MIRROR 提高了关系一致性,同时保留了一般视觉语言任务的性能。