论文

用于欺骗感知说话人验证的大型音频语言模型

Large Audio Language Models for Spoofing-Aware Speaker Verification

模型评测模型能力评测

摘要

文本转语音和语音克隆方面的最新进展使得高质量欺骗变得廉价且可扩展,威胁到语音身份验证系统,尤其是自动说话人验证 (ASV)。现有的防御措施主要通过用于深度伪造检测或欺骗感知说话人验证 (SASV) 的二进制对抗措施 (CM) 来应对这一威胁,其中当前系统以模块化 ASV-CM 融合和级联管道为主。尽管大型音频语言模型 (LALM) 在相关音频任务(包括 CM 和 ASV)上表现出了良好的前景,但它们在 SASV 中的使用仍未得到探索,尽管它们有能力为审计提供自然语言原理,并且具有超越歧视性预测的稳健性。这项工作在零样本提示、监督适应、面向推理的训练和基于强化学习的优化下,系统地评估了 SASV 的 LALM 与传统管道的比较。我们的结果表明,预训练的 LALM 在零样本设置中几乎是偶然的,这证实了它们本身并不适合 SASV,但特定于任务的适应弥补了这一差距。我们进一步发现,有竞争力的 SASV 性能可以通过几种不同的途径来实现。这些发现将 LALM 定位为统一 SASV 的有前景且可审计的基础,同时阐明了传统级联系统仍处于领先地位。