论文

精炼买可懂度,搜索买身份:掩码扩散TTS的测试时算力买到什么

Refinement Buys Intelligibility, Search Buys Identity: What Test-Time Compute Buys in Masked-Diffusion TTS

应用与实践语音交互与综合语音服务

摘要

面向文本到语音的扩散语言模型结合两种计算形式:模型深度(参数)与精炼步数(推理预算)。我们追问它们是否跨能力同等扩展。我们在2000小时语音上训练15个深度不同(19-133M参数,3种子)的掩码扩散编解码TTS模型,推理时扫描精炼步数T∈[1,16],以ASR词错率(可懂度)与说话人验证(身份)在174个留出说话人上度量零样本合成。对照实测下限:精炼弥合可懂度范围的86.2%,但仅弥合身份范围的46.4%——1.86倍的不对称跨多个误差指标稳健。以3倍与6倍排程重训减弱但不逆转该差距(1.84→1.36→1.23倍),因为可懂度随步数饱和而身份持续改善。Best-of-K搜索在精炼失败处恢复说话人身份,四个独立编码器上胜率64.6-79.0%。深度与步数不可互换:可分离的B(d)B(T)显著优于替代模型(ΔAICc=+69.3);分析显示剩余身份缺口的62%位于编解码器而非生成器。结论:精炼与深度针对不同瓶颈,应分别优化。