论文
语音基础模型是否能像人类一样感知说话者的相似性?
Do speech foundation models perceive speaker similarity as humans do?
摘要
本研究对语音基础模型的说话者嵌入与人类对说话者相似度的主观感知进行了比较分析。人类听众有能力连续判断说话者的相似度,辨别两个声音的相似程度。相比之下,语音基础模型将说话者特征嵌入到数字表示中。然而,仍然存在一个问题:这些模型中说话者嵌入之间的数值距离是否真正与人类感知的相似性一致?为了解决这个问题,我们使用 40 多个模型进行了全面调查,将模型得出的距离与人类感知的相似度得分进行比较。此外,我们还确定了模型配置中的哪些因素对反映人类感知的说话人嵌入贡献最大。我们的研究结果为开发更加基于感知的语音基础模型提供了见解。