论文

视听中的构图失败 LLM:跨模态冲突下的后层优先主导

Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict

模型评测模型行为与机制分析

摘要

我们研究视听冲突作为 AV-LLM 的组合泛化测试:模型必须结合同步但语义不兼容的音频和视频证据,并决定这对是否匹配。在 VideoLLaMA 2-7B-AV 上,三种对齐配置在 AVHBench 的评分精确字符串 Yes/No 子集上仍然很接近,尽管它们的输出先验发生了很大的变化。同样,现成的 InternVideo2 在跨模式冲突下准确率下降了 32.3%,并伴有 17.3% 的指令跟踪失败。我们将这种故障模式称为先验主导:后期层对内部首选答案模式的承诺,该模式在冲突输入中的基础薄弱。为了解释这种行为,我们进行了机械可解释性分析,发现承诺仍然集中在 25.5 $\pm$ 1 层。我们表明,更强的时间对齐变化可以解决偏见,但不能改善组合冲突的解决。可在 https://github.com/AdarshSudheer09/AVHBench-dmai 上获取用于重现我们的机械审计和行为评估的代码和数据。