论文

DiffSynth-Music:用于可控音乐生成的音频 KV 缓存适配器

DiffSynth-Music: Audio-Conditioned KV-Cache Adapters for Controllable Music Generation

应用与实践内容创作

摘要

文本和歌词指定了广泛的音乐特征和演唱内容,但对音乐节奏、旋律和基于参考的风格提供了有限的控制。我们引入了 DiffSynth-Music (https://modelscope.cn/models/DiffSynth-Studio/DiffSynth-Music),这是一个通过分层键值注入向音乐合成主干添加可组合音频调节的框架。三个模板模型(Control、Prosody 和 Reference)从主干扩散Transformer初始化,并使用条件流匹配进行训练。它们支持五种控制类型:节拍、人声、伴奏、韵律和参考音频。共享的变分自动编码器将调节波形映射到公共潜在空间,从而能够组合它们的注意力记忆。由于模板时间步长固定在干净数据端点并且其他输入保持不变,每个控制缓存只计算一次并在整个采样过程中重复使用。训练对是使用节拍提取、源分离、声音再合成和参考摘录选择从音乐录音中导出的。对普通话和英语歌曲的单控制评估表明,与骨干相比,所有五种控制类型的依从性都有所提高,并且在声音条件下的歌词保真度更高。自动音乐质量和指令遵循分数与评估的基本模型的分数大致相当,并具有特定指标的权衡。我们发布了三个模板模型来支持可控音乐生成的研究和创意应用。