论文
通过原型网络的合成语音归因
Synthetic Speech Attribution via Prototypical Networks
摘要
合成语音归因旨在识别负责语音信号的生成系统,但当前的方法通常依赖于黑盒神经网络,而黑盒神经网络对其决策的洞察力有限。这项工作研究了基于原型的网络作为一种可解释的替代方案,其中预测是基于与代表性训练示例的比较。我们使 ProtoPNet 适应基于声谱图的语音表示,并在封闭集、跨语言和开放集条件下在 MLAAD 数据集上评估所提出的框架。实验表明,与基线相比,基于原型的推理实现了有竞争力或改进的归因性能,同时支持基于示例的解释。这些结果强调,通过基于原型的建模,可以在合成语音归因中共同实现可解释性和性能。