论文

谁说了什么:音视频 LLM 的符号三模态绑定

Who Says What: Symbolic Trimodal Binding Mechanisms in Audio-Visual LLMs

模型评测模型行为与机制分析

摘要

目前的视听大语言模型(AVLLM)很难对具有多发言者对话的视频进行推理。在此类视频中,解决“谁说什么”至关重要,这需要三模态(文本-音频-视频)绑定。受到这些挑战的激励,我们系统地研究了 AVLLM 中如何实现这种三模态绑定。具体来说,我们识别了 AVLLM 中利用特定模态符号变量的新兴符号三模态绑定机制。通过将听觉和视觉成分编码为符号变量(分别捕获时间话语序列和空间实体坐标),该模型在这个抽象空间内建立了跨模式链接。至关重要的是,我们揭示了当三模态绑定失败时,故障主要源于未对齐的视听连接。为了克服这个瓶颈,我们引入了一种利用现成的活跃说话者检测(ASD)模型的视听提示方法。通过简单地将视觉边界框叠加在活动发言者上,这种无需训练的方法就可以在四个以对话为中心的基准测试中立即获得性能提升。此外,对这些 ASD 提示视频进行不到 300 个步骤的轻量级微调,将这些增益扩展到三个通用 AV 基准,表明我们的方法具有通用性。

通过时间ID、位置ID和语义内容干预,分析音视频推理中的跨模态绑定。
图3(图注摘要):通过时间ID、位置ID和语义内容干预,分析音视频推理中的跨模态绑定。