论文
Audio-Omni:将多模式理解扩展到多功能音频生成和编辑
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
摘要
多模态模型的最新进展刺激了音频理解、生成和编辑方面的快速进步。然而,这些功能通常由专门的模型来解决,从而导致开发真正统一的框架来无缝集成所有这三个任务。虽然一些开创性的作品探索了统一音频理解和生成,但它们通常仍然局限于特定领域。为了解决这个问题,我们推出了 Audio-Omni,这是第一个端到端框架,可以统一一般声音、音乐和语音领域的生成和编辑,并具有集成的多模式理解功能。我们的架构将用于高级推理的冻结多模态 大语言模型 与用于高保真合成的可训练扩散 Transformer 相结合。为了克服音频编辑中的关键数据稀缺问题,我们构建了 AudioEdit,这是一个新的大型数据集,包含超过一百万个精心策划的编辑对。大量实验表明,Audio-Omni 在一系列基准测试中实现了最先进的性能,超越了之前的统一方法,同时实现了与专业专家模型相当或优于专业模型的性能。除了其核心功能之外,Audio-Omni 还展示了卓越的继承功能,包括知识增强推理生成、上下文生成和音频生成的零样本跨语言控制,突出了通用生成音频智能的有前途的方向。代码、模型和数据集将在 https://zeyuet.github.io/Audio-Omni 上公开发布。