论文

VocalParse:利用大型音频语言模型实现统一且可扩展​​的歌唱语音转录

VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models

应用与实践语音识别与转写

摘要

高质量的歌唱注释是现代歌声合成 (SVS) 系统的基础。然而,由于需要大量的劳动力和音乐专业知识,通过手动标记大规模获得这些注释是不现实的,因此自动注释非常必要。尽管它们很实用,但当前的自动转录系统面临着重大挑战:它们通常依赖于复杂的多级管道,难以恢复文本注释对齐,并且对分布外(OOD)歌唱数据表现出较差的泛化能力。为了缓解这些问题,我们提出了 VocalParse,这是一种基于大型音频语言模型 (LALM) 构建的统一歌声转录 (SVT) 模型。具体来说,我们的新颖贡献是引入了一种交错提示公式,该公式联合对歌词、旋律和单词音符对应进行建模,产生直接映射到结构化乐谱的生成序列。此外,我们提出了一种思想链(CoT)风格的提示策略,该策略首先将歌词解码为语义支架,显着减轻上下文破坏问题,同时保留交错生成的结构优势。实验表明,VocalParse 在多个歌唱数据集上实现了最先进的 SVT 性能。源代码和检查点可在 https://github.com/pymaster17/VocalParse 获取。