论文

当视觉为声音说话

When Vision Speaks for Sound

模型评测模型行为与机制分析

摘要

尽管支持视频的 MLLM 取得了快速进展,但我们发现它们对视频中明显的音频理解通常是视觉驱动的:模型依靠视觉线索来推断或幻觉声音信息,而不是验证音频流。这个问题出现在最先进的开源全向模型和来自 Google 和 OpenAI 等提供商的领先闭源模型中。我们将这种故障模式描述为视听聪明汉斯效应,其中模型看起来(错误地)基于音频,但实际上利用了视觉声学相关性,而不验证音频和视觉流是否真正对齐。为了系统地研究这种行为,我们引入了 Thud,这是一种基于三个反事实音频编辑的干预驱动的探测框架:Shift,测试时间同步;静音,测试声音的存在; Swap,测试视听一致性。除了诊断之外,我们还进一步研究了一个两阶段的对齐方法:干预衍生的偏好对教授音频验证,而事件级别的一般视频偏好则规范模型以防止过度专业化。我们最好的 10K 样本配方将三个干预维度的平均性能提高了 28 个百分点,同时略微提高了一般视频和视听 QA 基准的性能。