论文
TS-SP:学习音频中的说话人保留表示大语言模型
TS-SP: Learning Speaker-Preserving Representations in Audio Large Language Models
摘要
音频大语言模型 (ALLM) 可以理解语音内容,但它们对验证使用说话者身份的能力仍然有限。我们提出了 TS-SP(两阶段说话人保留),这是一种参数高效框架,用于学习说话人保留表示并使它们可供 ALLM的语言模型组件访问。我们在 Qwen2.5-Omni-7B 上实例化并评估 TS-SP。首先,我们采用说话者身份监督的音频编码器。然后,我们冻结适应的编码器并训练语言模型来比较说话者。两个阶段都使用低秩适应 (LoRA),保持预训练的基本权重固定。在 Vox1-O 上,TS-SP 将配对损耗适应基线的等错误率 (EER) 从 7.01% 降低到 4.37%。在看不见的提示下,EER保持在4.31--4.79%以内。 CN-Celeb 上的跨域评估产生与基线相似的 EER,但在本机决策阈值上的准确性较低。这些发现支持在评估的骨干模型上进行两阶段调整以改进扬声器验证。
