论文

干预,而不是共享潜在因素:阻止音频-视频生成中的视觉捷径

Intervention, Not Shared Latents: Blocking Visual Shortcuts in Audio-Video Generation

模型评测模型行为与机制分析

摘要

联合音频-视频(AV)生成器接受数据训练,其中 \emph{事件看起来像什么} 和 \emph{听起来像什么} 是虚假相关的。我们对由此产生的故障模式进行了\emph{受控因果研究}。在 AV 结构因果模型中,音频在结构上独立于视频的令人讨厌的外观,让音频直接读取视频的模型——通过交叉注意力或共享潜在——学习 \emph{视觉捷径}:它们根据外观而不是因果事件来预测声音,并且当外观-事件相关性在测试时被打破时,合成错误事件的声音。至关重要的是,通过 \emph{共享共因潜在} 路由两种模态的流行补救措施并没有解决这个问题——瓶颈、无监督的共享/私有分解和忠实的共享先验模型都抓住了外观代理并像直接模型一样失败。相反,阻止捷径需要 \emph{对麻烦的干预}:在上述假设下,我们证明反事实不变性对于识别因果预测变量是必要且充分的,并且我们验证了从特征向量 SCM 到程序像素视频、带有频谱图音频的真实图像、移动真实数字和条件生成器的机制。在\emph{真实的、预训练的} V2A 生成器(MMAudio)上,输入干预测试表明该模型远非不变性,无法进行与声音无关的编辑,尽管通用噪声控制表明它是广泛的输入脆弱性而不是特定的颜色快捷方式——快捷方式的干净隔离需要我们的综合研究提供的受控混淆。我们描述了捷径发生时的特征,将目标与有监督的反事实增强进行比较,并将无法应用干预的\emph{未知滋扰}制度隔离为核心开放问题。