论文

语义头专业化指导多模态的混合 ViT 注意力 LLM

Semantic Head Specialization Guides Hybrid ViT Attention for Multimodal LLMs

模型架构Transformer

摘要

混合注意力主导前沿 LLM,但多模态 LLM 中的 Vision Transformer (ViTs) 缺乏令人满意的混合设计,对于为什么某些注意力模式效果更好还没有达成共识。为了填补这一空白,我们研究了 ViT 注意力头,发现它们分化为对象专家角色和背景专家角色,这种模式在充分注意力下最为明显;我们称之为语义头专业化(SHS)。我们提出 SHS-Index 来量化这种专业化,表明它区分了全注意力和块窗口 ViT,并发现它强烈跟踪下游基准性能。然后,我们确定了塑造 SHS 的三个结构因素——窗口交互、词元序列化和局部 softmax 分配——并将它们用作混合注意力的设计原则。在这些因素的指导下,我们设计了 Ariadne Attention,这是一种混合体,可以在 6.5 倍的注意力计算下,对 22 个图像和视频任务进行充分关注。我们的研究结果将头部专业化作为一种​​可测量的属性,用于在多模态 LLM 量表上诊断和设计有原则的混合 ViT 注意力。