论文
看到应该听到的内容:诊断和修复全模态大语言模型中的跨模态快捷方式
Seeing What Should Be Heard: Diagnosing and Repairing Cross-Modal Shortcuts in Omni-Modal LLMs
摘要
全模态大语言模型 (LLM) 预计会使用其明确引用的模态来回答问题。然而,现有的训练范例很少验证模型是否确实遵循这种模式,因为来自同一样本的多模态输入通常为同一答案提供冗余证据。在这项工作中,我们发现了全模态大语言模型中普遍存在的跨模态捷径:当被问到与音频相关的问题时,模型对图像的依赖程度与对音频的依赖程度不相上下,有时甚至更多。为了系统地诊断这种行为,我们引入了分解模态诊断,它在样本之间独立交换音频和图像,以隔离每种模态的因果贡献。在不同设置的两个模型系列中,我们发现这种捷径在整个监督微调和训练后强化学习中持续存在,而基于判断的强化学习可能会进一步放大这种对不相关视觉信息的依赖。基于这一发现,我们提出了 DMC-Repair,它在同类跨模态交换样本上训练模型,同时根据问题指定的模态分配监督。这可以防止模型利用同一剪辑中模态之间的虚假对应关系。实验表明,DMC-Repair 将图像引起的答案效应份额降低了 59.9%,有效抑制了跨模态捷径,同时又不影响音频问答性能。快捷方式依赖的减少泛化到两个模型系列和零样本到未见过的数据集和未见过的基准,并在后续的训练后持续存在。代码可在 https://anonymous.4open.science/r/DMC-Repair. 获取