论文

结合小波提示调优的防伪说话人验证共享编码器

Unified Shared Encoder in Spoof-Aware Speaker Verification with Hybrid Wavelet Prompt Tuning

模型训练模型评测应用与实践参数高效训练安全与风险评测语音交互与综合语音服务

摘要

欺骗感知说话人验证 (SASV) 必须确认谁在说话并且该语音是真实的,但当前的系统以牺牲另一个为代价来获得其中之一。模块化级联是准确的,但运行两个大型自监督编码器,而端到端模型虽然高效,但当单个嵌入必须服务于两个相互冲突的目标时,就会失去准确性。我们证明,效率和专业化之间的这种权衡是可以避免的。通过深度混合小波提示调优(WPT)对每个任务调整单个冻结的 W2V-BERT~2.0 主干,因此每个分支通过专用提示和任务头获得自己的共享编码器视图,并且仅在推理时组合分数。仅训练大约 7M 个参数,这只是强大的双编码器级联所需参数的一小部分,该系统在 SpoofCeleb 评估中以 0.03% CM-EER 和 0.038的最小a-DCF 超越它,而 0.16% 和 0.047。由于主干是共享和冻结的,因此新的分支会连接起来,而无需重新训练已经就位的头部和提示。在 ASVspoof5 上,在对抗性攻击和编解码器失真的情况下,仅使用提供的数据即可达到 0.092的最小a-DCF 和 3.60% CM-EER,表明该设计能够承受现实的野外威胁。

结合小波提示调优的防伪说话人验证共享编码器:论文原图
图 1:建议的 SASV 任务 USE 架构。在每个Transformer层,两个相同颜色的箭头表示同时注入常规和小波提示集。