论文

是什么让合成语音听起来很讽刺?韵律控制的感知研究

What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study

模型评测模型能力评测

摘要

韵律在讽刺感知中发挥着重要作用,但之前的研究依赖于自然产生的语音,缺乏对个体声学维度的细粒度控制。由于韵律线索在自然数据中共同变化,分离它们的独立贡献仍然具有挑战性。我们引入了一个受控框架,使用神经文本转语音 (TTS) 和基于提示的韵律调节来控制语速、音高变化和响度。构建正交刺激集是为了能够对韵律提示效果进行因果测试。人类听众对讽刺和自然程度进行评分,并将他们的判断与能够处理音频输入的基础模型的预测进行比较。结果表明,响度主要驱动人类的讽刺感知,而模型对语速赋予更大的权重,表明行为一致性有限。这项研究展示了可控神经 TTS 如何能够研究语音感知中的韵律线索权重。