论文

CoLMbo-SV:结合声纹核验与可检查声学解释

CoLMbo-SV: A Grounded Language Model for Explainable Speaker Verification

应用与实践语音识别与转写

摘要

说话人验证系统具有很高的准确性,但很少考虑其判断背后的声学证据。要使这些系统可检查,需要公开可解释的证据,同时保留其决策所依赖的更丰富的信息。我们提出了 CoLMbo-SV,一种说话人语言模型,它将强大的说话人辨别力与结构化的、基于声学的比较报告相结合。通过将预先训练的说话人编码器连接到语言模型并提供明确的声学测量,CoLMbo-SV 可以检查语音比较,而无需限制对其报告中口头证据的验证。我们还引入了 VoxReason,将录音与测量的声学特性以及通过数字和定性检查过滤的比较报告相结合,为这种组合功能提供监督。我们还开发了一个评估框架,将说话者表示编码的声学信息、影响验证分数的因素以及生成的报告讨论的内容分开。在 VoxCeleb1-O 上,CoLMbo-SV 实现了 0.99% EER,相对于在 VoxReason 上微调的最强音频语言基线,验证错误减少了约 80%,同时获得了 0.82 的数字基础分数。我们的分析进一步表明,声学正确性和决策相关性是解释的不同属性,暴露了数字基础指标所遗漏的差距。总之,这些贡献极大地推进了音频语言说话者验证,使其准确性接近专用说话者编码器,同时添加可检查的声学报告,并建立了一个将自然语言解释与其解释的决策联系起来的经验框架。