论文

逐词元分析多模态生成中的注意力变化

Attending to Multimodal Generation One Token at a Time

模型评测模型行为与机制分析

摘要

多模态 大语言模型 (MLLM) 以自回归方式生成响应,在不断变化的上下文中集成视觉和语言信息。先前关于可解释性的工作主要集中在各个层和电路(在哪里),而在生成期间(何时)的多模态计算的 词元级 动态尚未得到充分探索。我们解决了这一差距并根据语义角色研究注意力转移;跟踪模型对图像、文本、指令和先前生成的标记的关注,一次一个标记 (OTaT)。我们引入了多模式任务,这些任务需要在单个响应中在视觉和文本上下文之间进行显式切换。在两个主流模型系列和四个不同大小的开放权重 MLLM 中,我们建立了一致的模式:对需要图像衍生信息的标记处的图像峰值的关注,在任务转换期间重新访问指令标记,以及随着生成的进展对先前生成的标记的关注增加。因果注意力阻断干预措施验证了这些趋势的功能作用。我们分析了注意力中断下的模型行为,并观察了回落到语言先验的反应,或表现出跨模式泄漏、否认或恢复。最后,通过我们新颖的分析了解注意力动态,我们提出了一种简单的测试时间干预,以在正确的时间提高对相关模态的注意力,从而显着提高多模态任务表现。