论文
MLLM 听到了什么?音频 MLLM 可解释性的词元级频谱时间基础
What Did the MLLM Hear? Token-Level Spectro-Temporal Grounding for Audio MLLM Explainability
摘要
基于音频的多模态大语言模型 (MLLM) 可以生成复杂声学场景的详细自然语言描述,但仍不清楚输入音频的哪些部分支持每个生成的标记。这是特别具有挑战性的,因为声学证据分布在时间和频率上,并且并发的声音事件可能在时间上重叠,同时占据不同的频谱区域。我们引入了 STAG,据我们所知,这是第一个用于基于音频的 MLLM 生成的字幕的词元级频谱时间基础的事后框架。 STAG 使用编码音频表示的目标标记特定词汇投影来估计每个生成标记的时间支持,通过受控频谱遮挡测量频带相关性,并将两个信号组合成频谱时间相关性图。我们在四个基础基准上针对十种事后解释方法评估了 STAG,它在每个数据集上实现了最佳事件定位性能,并将其应用于八个音频语言主干,无需参数更新。反事实删除进一步表明,有选择地删除已识别的证据会降低对相应事件的置信度,并经常将其从重新生成的标题中删除。这些结果为解释的忠实性和选择性提供了行为支持。