论文
MeloCodec:利用旋律先验实现高保真歌声表示
MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation
摘要
神经音频编解码器充当基于 LLM 的音频生成的基本标记器。虽然语义先验被广泛利用来增强语言可懂度,但显式声学先验的整合仍未得到充分探索,限制了频率敏感领域的合成保真度。为了解决这一差距,我们引入了 MeloCodec,这是一种新颖的框架,旨在有效地整合旋律先验(歌唱声学信息的一种关键形式)。为了解决通常由此类显式先验的直接融合引起的优化不稳定性,我们提出了一种 Tokenize-then-Fuse 范例,该范例预先训练离散旋律分支以在特征融合之前锁定结构。为了稳健地实现这一范式,我们进一步提出了一种两阶段训练策略,可以防止码本崩溃并确保稳定收敛。实验表明,MeloCodec 在歌声表现方面优于基线,提高了音高一致性,并实现可控音高操纵,同时将音色退化降至最低。