论文

探测视听大语言模型中的跨模态信息枢纽

Probing Cross-modal Information Hubs in Audio-Visual LLMs

模型评测模型行为与机制分析

摘要

视听大语言模型(AVLLM)近来成为一种能够对音频、视觉与文本模态进行联合推理的强大架构。在AVLLM中,音频与视频模态间的双向交互引入了复杂的处理动态,因而需要更深入地理解其内部机制。然而,与已被广泛研究的纯文本模型或大型视觉语言模型不同,AVLLM的内部运作在很大程度上仍未被探索。本文聚焦AVLLM中音频与视觉模态之间的跨模态信息流,研究来自某一模态的信息被编码在另一模态的token表示中的哪些位置。通过对多个近期AVLLM的分析,我们揭示了两个共性发现。第一,AVLLM主要在sink token中编码整合的视听信息。第二,sink token并非均匀地持有跨模态信息。相反,其中一个独特的子集——我们称之为跨模态sink token——专门负责存储这类信息。基于这些发现,我们进一步提出一种简单的免训练幻觉缓解方法,通过促使模型依赖跨模态sink token中的整合跨模态信息来实现。我们的代码发布于 https://github.com/kaistmm/crossmodal-hub。

探测视听大语言模型中的跨模态信息枢纽:论文配图
图 1:跨模式信息主要存储在跨模式接收器令牌中。考虑一下海狮吠叫的视听片段。跨模式接收器令牌聚合来自两种模式的线索,而单模式接收器令牌仅对来自其本机模式的信息进行编码。