论文

ARIA:结合歌声音调估计与检索增强语言模型创作粤语歌词

ARIA: Audio-Driven Melody-Tone Relation Modeling for Cantonese Lyric Authoring

应用与实践内容创作

摘要

粤语歌词的写作要求词汇声调和旋律音高紧密结合。现有的旋律引导歌词生成方法通常依赖于符号旋律来生成歌词。然而,在真实的歌曲创作场景中,旋律通常被表达为原始演唱音频或哼唱录音,其中音高是隐含的、嘈杂的且非结构化的,使得这些方法难以直接应用。为了解决这个限制,我们提出了 ARIA,这是一种用于粤语歌词创作的两阶段音频驱动的旋律音高关系建模框架,它可以根据提供的字符级时间戳从歌唱录音中生成粤语歌词。具体来说,我们首先设计了一个三流关系感知音调估计器(TRATE),通过对多流声学线索和关系音调结构进行建模,从带时间戳的歌唱音频中预测 0243 序列。然后,我们提出了一种解耦检索增强音调调节歌词生成器(DRA-TCLG),以根据预测音调计划和检索增强词汇指导生成流畅的歌词。此外,我们从真实的粤语演唱录音中构建了一个大规模对齐的音频-Jyutping-0243数据集来支持这项新任务。实验结果表明,ARIA 在 0243 预测和音调一致的歌词生成方面均取得了出色的性能,验证了所提出框架的有效性。

ARIA:结合歌声音调估计与检索增强语言模型创作粤语歌词:论文原图
图 2:ARIA 的整体架构。该框架通过统一的 0243 中间表示将音频侧音调计划估计和文本侧歌词生成解耦。在第 1 阶段,TRATE 通过使用门控融合和关系感知序列建模对绝对、轮廓和相对声流进行建模,根据歌唱音频和字符级时间戳来预测 0243 控制序列。在第二阶段,DRA-TCLG 根据预测的音调计划生成粤语歌词,首先学习基调到歌词的映射,然后结合来自频率感知 0243 词典的检索增强词汇指导。