论文
层、注意力汇聚与缩放:多模态大模型的自适应证据选择
Layers, Sinks, and Scaling: Adaptive Evidence Selection for Multimodal Large Language Models
摘要
多模态大模型通过结合图像视觉证据和外部检索事实,回答知识密集视觉问题,但可能忽视两个模态中的相关证据,对正确作答所需文本句子或图像区域关注不足。近期方法在生成前突出检索文本、标记视觉区域,却采用固定一次性策略,不能适应是否需要突出、不同样例需要多少证据,以及回答展开时不同文本何时相关这三种变化。我们提出无需训练的推理时方法AREA,将证据突出表述为自适应分配。它生成单个探针token,从固定骨干层读取视觉与文本相关性,再作三种决策:由自然注意力覆盖和视觉注意力汇聚污染控制是否干预;由相关性熵决定暴露多少证据;由因果上下文注意力峰值触发生成期间何时刷新文本。在四个知识型视觉问答和七个标准多模态基准、九个冻结模型检查点上,该方法在无需训练的突出方法中取得最佳表现。
