论文
所有模式都是平等的,但视频更平等:缩小联合视频生成中的交叉注意力差距
All modalities are equal, but video is more equal: Closing the Cross-Attention Gap in Joint Video Generation
摘要
视频是物理事件的丰富表现,捕捉外观、几何形状、运动和时间演变。其他模式,例如 3D 身体运动或音频,对同一事件的较窄方面进行编码。我们发现联合多模态扩散变换器在跨模态对应中表现出相应的不对称性:伴随模态与视频形成强烈的对应关系,但它们限制视频的相互对应关系仍然较弱。我们将两个方向表示为视频标记上的可比对应分布,并将它们的分歧定义为相互对应间隙。我们引入 RecCAR,代表互惠跨模态注意正则化,它是一种 KL 正则化器,它使用完善的视频到模态对应关系作为固定参考,并将较弱的模态到视频对应关系与其对齐。在视频-运动和视频-音频联合生成中,RecCAR 将人体解剖学分数从 0.69 提高到 0.75,并将音频-视频不同步从 0.804 降低到 0.752,同时提高整体生成质量。