论文

音视频模型中的注意力三角

The Attention Triangle in Audio-Video Models

模型评测模型行为与机制分析

摘要

音频-视频扩散模型依赖于跨模态注意力来协调文本、声音和视觉内容,但同样的机制可能会引入微妙和系统的语义泄漏。我们通过探测和分析“注意三角形”(包括连接文本、音频和视频流的三个交叉注意边)来研究这些模型,并检查语义信息在生成过程中如何跨模态路由。我们的分析表明,沿着音频-视频边缘的路由是双向的:音频可以影响视频生成,而视频可以影响音频生成。这种边缘是由模型参数中编码的偏差形成的,并成为泄漏的主要因素:当提示与学习的先验发生冲突时,跨模式交互可能会覆盖预期的条件并将语义重新路由到视觉上规范但不正确的结果。这些效应表明,语义伪影不仅源于注意力超出其预期目标,还源于沿着特定路径的结构化、偏见驱动的交互。基于这个观点,我们提取了来自注意力的信号,这些信号揭示了语义如何在模态中分布和扎根,并将它们用作诊断工具,以在受控条件下分析和故意引发泄漏。这使我们能够探究跨模式路由的内部动态并隔离个体交互的作用。我们进一步利用这些信号来指导推理时间干预,以鼓励更一致的跨模式对齐。大量的实验支持我们的分析,并证明了语义基础的改进,同时保持了生成质量。

音视频模型中的注意力三角:论文配图
图1音频视频模型中的注意三角。左上角:基线T2AV一代出现大量渗漏;海盗在视觉上继承了鹦鹉式的属性,成为讲源。右上角:我们的文字恢复了海盗的外貌,但演讲仍然被海盗误认为是地方性的。左下角:我们的AV正确定位了对鹦鹉的演讲,但海盗的外表持续泄漏。右下角:我们共同恢复了正确的外观,将演讲定位到预定的源头。提示值见下图。4个制作的视频例子 放在一个两乘二的网格里 一个码头场景和一个海盗和一个鹦鹉基线给出了海盗鹦鹉的视觉特征 让海盗说话我们的文字恢复了海盗的外貌 但让海盗发表演讲我们的AV在鹦鹉上演讲 但留下海盗的目视腐败保护海盗的外貌 派鹦鹉来演讲