论文

超越短段:使用矢量档案扩展说话人嵌入

Beyond Short Segments : Expanding Speaker Embeddings with Vector Archives

应用与实践结构化分析、预测与决策

摘要

由于说话人特定信息不足,最先进的说话人验证 (SV) 系统的性能在短说话时会严重下降。为了应对这一关键挑战,我们提出了矢量档案映射 ECAPA (VAM-ECAPA),这是一种旨在增强短时语音特征提取的新颖系统。我们系统的核心是基于 Transformer 的带有统计池的向量档案映射 (TVAMSP) 模块,该模块通过将信息稀缺特征映射到可学习的规范说话人特征向量档案来丰富信息稀缺特征。通过将 TVAMSP 模块集成到强大的 WavLM+ECAPA-TDNN 基线中,我们的系统学习将短片段中的稀疏特征映射到鲁棒的、有辨别力的说话者表示中。 VoxCeleb1 基准测试表明,我们提出的 VAM-ECAPA 在 1 秒测试段上实现了极具竞争力的 EER 8.334%,与传统训练的基线相比,相对误差降低了 54.8%。