论文

TS-SP:学习音频中的说话人保留表示大语言模型

TS-SP: Learning Speaker-Preserving Representations in Audio Large Language Models

模型训练参数高效训练

摘要

音频大语言模型 (ALLM) 可以理解语音内容,但它们对验证使用说话者身份的能力仍然有限。我们提出了 TS-SP(两阶段说话人保留),这是一种参数高效框架,用于学习说话人保留表示并使它们可供 ALLM的语言模型组件访问。我们在 Qwen2.5-Omni-7B 上实例化并评估 TS-SP。首先,我们采用说话者身份监督的音频编码器。然后,我们冻结适应的编码器并训练语言模型来比较说话者。两个阶段都使用低秩适应 (LoRA),保持预训练的基本权重固定。在 Vox1-O 上,TS-SP 将配对损耗适应基线的等错误率 (EER) 从 7.01% 降低到 4.37%。在看不见的提示下,EER保持在4.31--4.79%以内。 CN-Celeb 上的跨域评估产生与基线相似的 EER,但在本机决策阈值上的准确性较低。这些发现支持在评估的骨干模型上进行两阶段调整以改进扬声器验证。

TS-SP:学习音频中的说话人保留表示大语言模型的原论文方法或结果图
图 1:TS-SP:第 1 阶段通过中间说话者监督学习音频 LoRA;第 2 阶段冻结适应的音频路径并训练 LM LoRA 进行扬声器比较。所有预训练的基本重量保持固定。