论文
像法官一样聆听:用于自动歌唱表演评估的音乐感知框架
Listening Like a Judge: A Music-Aware Framework for Automatic Singing Performance Evaluation
摘要
自动歌唱质量评估 (SQA) 需要在处理表达变化的同时评估歌词的正确性和音乐保真度。然而,现有系统很大程度上依赖于声音提示或歌词转录,限制了整体性能评估。此外,由于在旋律、颤音和节奏弹性中稳健的歌唱转录面临挑战,它们的集成并非易事。为此,我们提出了 MusicJudge,这是一种用于自动 SQA 的模态引导框架,它通过将歌词正确性与音高节奏保真度相结合来执行块对齐的多模态分析。它使用集成了语义嵌入、词汇相似性和语音对齐的多信号匹配来检测语义上有意义的歌词块。为了改进歌唱音频转录,我们引入了用于 ASR 微调 的模态引导 LoRA。跨数据集的实验表明与人类专家的判断高度一致,并验证了 MusicJudge 的普遍性。