论文

在人工智能生成的音乐检测中探索生成器转换下的词元空间

Probing Token Spaces under Generator Shift in AI-Generated Music Detection

模型评测模型能力评测

摘要

人工智能生成的音乐检测器在标准基准分割上看起来很强大,但它们的部署需要传输到训练期间不存在的生成器源。我们通过对 \textsc{MoM-open} 进行源限制评估来研究这个问题,这是 MoM-CLAM 的开放式重建,用 FMA 和 MTG-Jamendo 替换不可再分发的真实语料库,同时保留假生成器协议。为了隔离表示的角色,我们引入了 \textsc{CoMoE},这是一个紧凑的固定分类器,用于比较异构音频词元空间,同时保持下游架构和训练配方不变。实验表明,标准和真实源限制的分割几乎饱和,而假源限制暴露了词元空间之间的巨大差异:仅在 Udio 上训练时,X-Codec 词元最强,而仅在 Suno-v3.5 上训练时,MERT 派生词元更强。这些结果表明,在人工智能生成的音乐检测中,编解码器式离散词元空间应被视为生成器移位下的主要实验轴。我们的代码和数据可在 https://github.com/MAAP-LAB/CoMoE 上获取。