论文
SpeakerRPL v2:少样本适配与模型融合的开放集说话人识别
SpeakerRPL v2: Robust Open-set Speaker Identification through Enhanced Few-shot Foundation Tuning and Model Fusion
摘要
本文提出了一种基于预训练说话人基础模型的开放集说话人识别的改进方法。在之前的说话人互反点学习框架(V1)的基础上,我们首先通过将互反点学习与 logits 归一化(LogitNorm)相结合,并结合自适应锚点学习,引入增强的开放集学习目标,以更好地约束目标说话人表示并提高鲁棒性。其次,我们提出了一种模型融合策略来稳定和增强小样本调整过程,有效减少结果随机性并提高泛化能力。此外,我们引入了一种模型选择方法以确保模型融合的最佳性能。对 VoxCeleb、ESD 和 3D-Speaker 数据集的实验评估证明了该方法在不同条件下的有效性和鲁棒性。在新提出的 Vox1-O 类测试集上,我们的方法将 EER 从 1.28% 降低到 0.09%,相对降低了约 93%。