论文
探测视听大语言模型中的跨模态信息枢纽
Probing Cross-modal Information Hubs in Audio-Visual LLMs
摘要
视听大语言模型(AVLLM)近来成为一种能够对音频、视觉与文本模态进行联合推理的强大架构。在AVLLM中,音频与视频模态间的双向交互引入了复杂的处理动态,因而需要更深入地理解其内部机制。然而,与已被广泛研究的纯文本模型或大型视觉语言模型不同,AVLLM的内部运作在很大程度上仍未被探索。本文聚焦AVLLM中音频与视觉模态之间的跨模态信息流,研究来自某一模态的信息被编码在另一模态的token表示中的哪些位置。通过对多个近期AVLLM的分析,我们揭示了两个共性发现。第一,AVLLM主要在sink token中编码整合的视听信息。第二,sink token并非均匀地持有跨模态信息。相反,其中一个独特的子集——我们称之为跨模态sink token——专门负责存储这类信息。基于这些发现,我们进一步提出一种简单的免训练幻觉缓解方法,通过促使模型依赖跨模态sink token中的整合跨模态信息来实现。我们的代码发布于 https://github.com/kaistmm/crossmodal-hub。
