论文

SegTune:用于歌曲生成的结构化和细粒度控制

SegTune: Structured and Fine-Grained Control for Song Generation

应用与实践内容创作

摘要

神经歌曲生成的最新进展使得歌词和全局文本提示的高质量合成成为可能。然而,大多数系统无法对歌曲的随时间变化的属性进行建模,严重限制了对音乐结构和动态的细粒度控制。为了解决这个问题,我们提出了 SegTune,一种基于 Diffusion Transformer 的框架,通过允许用户或 大语言模型 (LLM) 指定与歌曲片段对齐的本地音乐描述,实现结构化和细粒度的可控性。这些分段提示会暂时广播到相应的时间窗口,而全局提示则确保风格的连贯性。为了支持精确的歌词与音乐对齐,我们引入了基于 LLM 的持续时间预测器,它以自回归方式生成 LyRiCs 格式的句子级时间戳。我们进一步构建了一个大规模的数据管道,用于高质量的歌曲集合,并具有对齐的歌词和提示,并提出了新的指标来评估片段对齐和声音一致性。实验表明,SegTune 在音乐性和可控性方面均优于现有基线。请访问我们的项目页面 (https://github.com/KlingAIResearch/SegTune) 以获取代码和更多生成的歌曲。