论文

S2Accompanist:用于音乐伴奏生成的语义感知和结构引导的扩散模型

S2Accompanist: A Semantic-Aware and Structure-Guided Diffusion Model for Music Accompaniment Generation

应用与实践内容创作

摘要

高保真文本到音乐的生成通常依赖于大量专有数据集和巨大的计算资源。现有模型通常难以生成连贯的纯音乐伴奏,并且由于依赖于粗略的曲目级注释而缺乏精确的本地化语义控制。为了解决数据和计算资源有限的情况下的这些限制,我们提出了 S2Accompanist,这是一种为 ICME2026 ATTM Grand Challenge 开发的语义感知和结构引导扩散模型。具体来说,我们设计了一个自动化数据管道,包括结构分段、大型音频语言模型驱动的分段级字幕和双度量质量分级,以克服原始数据集中本地化元数据的缺失。此外,我们提出了一种语义感知的变分自编码器 微调 策略,该策略将基础的 LeadSheet 结构显式地提取到声学潜在空间中,从而有效地提高整体音频保真度。大量实验表明,S2Accompanist 在 ATTM Grand Challenge 基准测试中的效率和性能方面均实现了最先进的客观性能。由于只有 402M 个参数,我们的模型与更大规模的无约束模型相比仍然具有竞争力,并在效率赛道上获得了第一名。