论文
ARIA:结合歌声音调估计与检索增强语言模型创作粤语歌词
ARIA: Audio-Driven Melody-Tone Relation Modeling for Cantonese Lyric Authoring
摘要
粤语歌词的写作要求词汇声调和旋律音高紧密结合。现有的旋律引导歌词生成方法通常依赖于符号旋律来生成歌词。然而,在真实的歌曲创作场景中,旋律通常被表达为原始演唱音频或哼唱录音,其中音高是隐含的、嘈杂的且非结构化的,使得这些方法难以直接应用。为了解决这个限制,我们提出了 ARIA,这是一种用于粤语歌词创作的两阶段音频驱动的旋律音高关系建模框架,它可以根据提供的字符级时间戳从歌唱录音中生成粤语歌词。具体来说,我们首先设计了一个三流关系感知音调估计器(TRATE),通过对多流声学线索和关系音调结构进行建模,从带时间戳的歌唱音频中预测 0243 序列。然后,我们提出了一种解耦检索增强音调调节歌词生成器(DRA-TCLG),以根据预测音调计划和检索增强词汇指导生成流畅的歌词。此外,我们从真实的粤语演唱录音中构建了一个大规模对齐的音频-Jyutping-0243数据集来支持这项新任务。实验结果表明,ARIA 在 0243 预测和音调一致的歌词生成方面均取得了出色的性能,验证了所提出框架的有效性。
