论文

GRAMformer:通过体积多模态交叉注意进行任意顺序模态交互

GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention

模型架构Transformer

摘要

基于 Transformer 的多模态模型依靠注意力机制来集成跨异构模态的信息。尽管取得了成功,但现有的多模态注意力公式通过成对点积交互的集合或通过将所有模态连接到键中来计算分数,即使应该共同涉及多种模态。因此,当前的方法要么会导致模态数量的二次复杂性,要​​么无法对依赖于多个表示的联合配置的交互进行显式建模。在这项工作中,我们引入了体积多模态交叉注意力(VMA),这是一种新颖的交叉注意力机制,其中注意力分数被定义为查询和多个特定于模态的键的联合几何形状的函数。 VMA 计算跨多种模态的查询和关键向量所跨越的体积,捕获超越成对相似性的联合多模态依赖性,从而实现任意顺序模态交互的本机建模。我们将 VMA 集成到我们新颖的多模态 Transformer 架构中,名为 GRAMformer,明确设计用于集成任意数量的模态。我们评估了所提出的多模式学习任务模型,证明了有效性和效率的提高。