论文
具有边界感知信息瓶颈的可控演唱风格转换
Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck
摘要
本文介绍了 S4 团队向 2025 年歌声转换挑战赛 (SVCC2025) 提交的作品,这是一种新颖的歌唱风格转换系统,可在域内设置中推进细粒度的风格转换和控制。为了解决风格泄漏、动态渲染和有限数据高保真生成等关键挑战,我们引入了三项关键创新:边界感知 Whisper 瓶颈,它池化音素跨度表示以抑制残留源风格,同时保留语言内容;显式的帧级技术矩阵,通过推理过程中的目标 F0 处理进行增强,以实现稳定且独特的动态风格渲染;感知驱动的高频频段补全策略利用辅助标准 48kHz SVC 模型来增强高频频谱,从而克服数据稀缺性而不会过度拟合。在官方 SVCC2025 主观评估中,我们的系统在所有提交的作品中实现了最佳的自然度表现,同时在说话者相似度和技术控制方面保持了有竞争力的结果,尽管使用的额外歌唱数据比其他顶级系统要少得多。音频样本可在线获取。