论文

RAVE:在大型多模态模型中重新分配视觉注意力

RAVE: Re-Allocating Visual Attention in Large Multimodal Models

模型架构Transformer

摘要

大型多模态模型(LMM)继承了预训练语言主干的自注意力机制,但标准注意力可能表现出次优分配,包括文本和视觉证据之间的跨模态错配以及视觉标记之间的视觉内不平衡。我们提出了 RAVE(重新分配视觉注意力),这是一种轻量级的配对门控机制,它将学习到的查询键偏差添加到 pre-softmax 注意力分数中而不是视觉键上,这些分数源自 RoPE 之前的查询和关键特征。 RAVE 不需要对主干进行架构修改,并且可以与模型的其余部分进行端到端训练。在一系列多模式基准测试中,RAVE 比标准注意力平均提高了 3 个百分点,其中在感知密集型任务(包括多语言 OCR、图表理解、文档 VQA 和场景文本 VQA)方面的进步最大,其中准确的视觉基础至关重要。