论文
语音词元会泄露声纹吗?针对端到端语音语言模型的说话人反转攻击
Do Speech Tokens Leak Voiceprints? Speaker Inversion Attacks Against End-to-End Speech Language Models
摘要
端到端语音语言模型越来越多地使用语音标记来表示用户语音,而不是仅仅依赖于级联 ASR--LLM--TTS 管道。尽管这些词元支持富有表现力和低延迟的语音交互,但它们也可能保留敏感的说话者特征。我们调查暴露的语音词元是否会泄漏声纹,并将这种风险表述为说话人反转攻击。我们引入了 Audio BERT (AuB),这是一种可训练的模型,它从离散码本构建词元嵌入并将其聚合成说话人敏感的表示,并提出了 SpInv,这是一种基于 AuB 构建的两阶段反转方法,用于恢复攻击者指定的说话人编码器空间中的嵌入。我们在 VoxCeleb 数据集上使用说话者不相交协议评估 Moshi、Higgs3、Kimi-Audio 和 Qwen3-Omni。大量实验表明,只需三秒的前端输出,SpInv 在攻击者指定的说话人编码器空间中即可实现 0.70 以上的余弦相似度。