论文
AVIO:学习在视听场景中添加和删除发声对象
AVIO: Learning to Add and Remove Sounding Objects in Audiovisual Scenes
摘要
添加或删除发声对象需要对视觉内容和声音进行协调更改,同时保留周围场景。然而,对局部非语音视听编辑的配对监督仍然有限,因为视觉和声学编辑必须针对同一对象并将其声音与重叠源隔离。为了解决这一差距,我们引入了 AVIOBench,这是一个包含 37.9 小时的配对视听示例的数据集,涵盖 1{,}878 个目标对象名称。 AVIOBench 通过共享身份和视觉掩模将每个目标对象的视觉存在和声学贡献联系起来。我们的自动化管道使用视觉基础和跨模态一致性来选择目标声音去除候选者,然后共同细化视听对以提高感知质量和跨模态一致性。在此数据集的基础上,我们提出了 AVIO,它通过源条件特征调制来适应预训练的文本到视听生成模型,以共同学习对象添加和删除。参考框架课程逐渐减少训练期间的参考调节,使一个模型能够通过可选的视觉指导执行仅限指令的编辑。定量和定性评估证明了视听对象的有效移除和添加,并提供了添加的外观和放置控制的可选参考指南。