论文
注意头脑:多模态的拓扑表示对齐 LLM
Mind the Heads: Topological Representation Alignment for Multimodal LLMs
摘要
表示对齐已成为改进多模态 大语言模型 (MLLM) 的有效方法,通过将其内部表示规范为外部视觉编码器的内部表示。然而,现有方法通常会对齐语言主干的固定层,而忽略了 Transformer 模型的细粒度结构。在这项工作中,我们提出了 Head-Wise Representation Alignment (HeRA),这是一种在个体注意力头级别强制执行跨模式对齐的方法。我们的方法基于柏拉图表示假说,重点是跨模态保留表示的拓扑结构(即它们的局部邻域关系)。遵循相互 K 最近邻(MKNN)对齐度量,我们引入了一个对比目标,它充当匹配局部结构的可微代理。 HeRA 在多模式训练期间将此目标应用于 LLM 中的特定注意头,根据 MKNN 指标通过其对齐分数进行选择。与直觉相反,我们发现对齐最不对齐的头部会产生最大的收益。对多个 MLLM 和 18 个基准的广泛评估表明,HeRA 持续提高了以视觉为中心的挑战性任务的性能,并通过自然地抑制对语言先验的过度依赖,成为对抗视觉幻觉的有效正则化器。我们的代码是公开发布的。