论文
自然但难以检测:通过 EMA 和双评分提示选择实现稳健的野外 TTS——提交 WildSpoof 2026 TTS Track
Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track
摘要
在本技术报告中,我们描述了我们向 WildSpoof 挑战 TTS 赛道提交的内容:使用野外数据进行文本转语音。我们引入 F5-TTS-DPS,这是一个基于 F5-TTS 架构构建的模型。我们的方法将指数移动平均线(EMA)集成到有监督的 微调 中,以稳定训练并提高泛化能力。为了提高合成保真度,我们利用 大语言模型 (LLM) 和大型音频语言模型 (LALM) 进行双评分提示选择,过滤参考音频和文本提示以确保质量,同时解决嘈杂数据集中的对齐问题。实验评估表明,F5-TTS-DPS 在开发集上取得了优异的性能,UTMOS 为 3.20,说话人相似度为 0.51。更重要的是,我们的模型在所有提交的三个先进 SASV 系统中实现了最佳 a-DCF 分数 0.1582、0.5233 和 0.2562,这表明我们的合成语音是最难检测的,并且表现出最高程度的自然性和真实性。结合具有竞争力的 WER 性能,这些结果验证了我们的方法在生成具有强大欺骗能力的自然语音方面的有效性。