论文

Spooftral:Voxtral 音频语言模型可以检测语音欺骗吗?

Spooftral: Can Voxtral Audio-Language Model Detect Speech Spoofing?

模型评测模型行为与机制分析

摘要

自监督学习(SSL)对策(CM)近年来表现出了强劲的表现。然而,在面临看不见的欺骗攻击和不匹配的条件时,它们经常表现出性能下降。本研究研究了用于欺骗检测的 Voxtral 音频语言模型 (ALM) 框架,作为在 ALM 框架内结合 CM 功能的一步。我们分析了 Voxtral 如何通过音频文本处理捕获欺骗线索,并提出一种指令引导方法,该方法使用标签序列可能性来评估善意和欺骗语音。 ASVspoof 数据库上的实验表明,如果没有特定于任务的适应,LLM 层会强调语义表示,与基于 Whisper 的音频编码器相比,降低了欺骗辨别性声音线索的可分离性。因此,在语言模型处理之后,与欺骗相关的信息变得难以分离。我们还将使用权重分解低秩自适应(DoRA)的轻量级自适应应用于 Voxtral 模型,并提出了 Spooftral 模型,在 ASVspoof5 评估集上实现了 4.25% 的等错误率(EER)。