论文

实现富有表现力和忠实的音频到图像生成:统一的多模态数据集和合成框架

Towards Expressive and Faithful Audio-to-Image Generation: A Unified Multimodal Dataset and Synthesis Framework

应用与实践内容创作

摘要

作为跨模态生成的一个重要子领域,从音频中合成图像形式的静态视觉内容,即音频到图像(A2I)生成,近年来引起了越来越多的研究关注。然而,尽管现代文本到图像(T2I)模型具有出色的视觉质量,但 A2I 的性能仍然从根本上受到传统数据集的限制,传统数据集通常缺乏高保真图像和精确的跨模态对齐。因此,现有方法仍然难以通过微调强大的 T2I 模型来实现高质量的音频到图像生成,从而限制了该领域的实际应用。受这一差距的推动,我们推出了 A2I-Set,这是一个统一的高质量三模态数据集,由 323K 配对音频、图像和详细文本字幕组成,专为视听研究(包括音频条件图像生成)而设计。此外,我们通过人工监督为 A2I 任务开发了一个新的混合源测试集。我们进一步提出了一个 A2I 模型 AudioCanvas,在我们的 A2I-Set 上进行了微调。实验表明,AudioCanvas 实现了更具视觉表现力以及跨模式对齐结果,通常优于现有方法。我们的数据集和源代码可在 https://github.com/gdx012/A2I-Generation 获取。