论文

重新思考音乐标记化:面向高保真 LLM 音乐生成的语义编解码器

Rethinking Music Tokenization: A Semantic Codec toward High-Fidelity LLM Music Generation

应用与实践内容创作

摘要

在最近的音乐生成中,离散音频标记化已成为原始波形和自回归建模之间的关键接口。因此,音乐标记器必须同时支持高保真重建并生成仍适合语言建模的离散序列。现有的面向重建的标记器通常将音乐结构与精细的声学细节混合在一起,产生难以建模的高熵标记。相比之下,语义引导的替代方案是为语音设计的,不太适合音乐,通常会损害重建质量。我们通过围绕基于下游音乐信息检索任务的音乐语义内容的可测量概念重新思考音乐标记化来解决这些权衡。在这个定义的指导下,我们提出了 MuSeC,一种音乐语义编解码器,可以直接从混合信号中分解语义和声学内容,无需进行源分离。 MuSeC 保留高保真重建所需的信息,同时生成更多 LM 友好的离散单元。根据经验,它提高了重建质量并产生更可预测的标记序列,为高保真 LLM 音乐生成提供了实用基础。可以通过此 https URL 获取演示。