论文

注意推理中重要的事情:通过选择性概率质量集中来调整跨模式注意力

Mind What Matters for Reasoning: Aligning Cross-Modal Attention via Selective Probability Mass Concentration

模型训练监督微调与指令调优

摘要

多模态大语言模型(MLLM)在视觉推理任务上取得了很强的性能,但仍然容易产生幻觉和过度依赖语言先验,通常在没有充分使用与任务相关的视觉证据的情况下生成答案。现有方法主要通过面向推理的监督或推理时间策略来改进推理。在这项工作中,我们研究了一个补充问题:可以通过加强隐式视觉基础而不直接监督推理过程来改进多模态推理吗?受注意力头功能专业化的推动,我们研究是否可以通过仅引导对视觉证据基础最敏感的头来改善推理。我们提出了选择性概率质量集中(sPMC),这是一种训练框架,可以识别对视觉证据定位响应最强的注意力头并选择性地规范他们的文本到图像的注意力。 sPMC 将视觉标记上的标准化注意力视为空间概率分布,并鼓励使用分割派生的空间先验将概率质量分配给语义相关的区域。自适应头部选择将此指导限制为视觉响应头部,同时使其余头部不受约束以保留其互补功能。在 6 个多模式基准套件中,sPMC 实现了 3% 的平均零样本改进,在多个 MLLM 中实现了高达 11.3% 的增益,同时仅规范了 3%-15% 的注意力头。这些结果表明,稀疏和隐式视觉证据路径的有针对性的指导可以直接改善多模态推理。