论文
韵律风格可以仅从文本推断出来吗?来自无监督声学集群的证据
Can Prosodic Style Be Inferred from Text Alone? Evidence from Unsupervised Acoustic Clusters
摘要
许多富有表现力的文本到语音研究都基于未经检验的假设,即书面文本携带足够的信息来选择合适的韵律风格进行传递。文本预测风格模型改善了听众的偏好,而表达适当性评估则以上下文限制风格为前提,但两者都没有衡量假设本身。本文将其作为针对仅源自声学的风格标签的可证伪假设进行测试。对于 1,200 小时会话语料库中的六个说话者中的每一个,话语都聚集在五个语音模型的空间中,包括仅韵律控制,并且留出话语的集群是根据 12 个文本嵌入模型预测的。应用了三个控制:从语音嵌入中删除话语长度;准确性是根据不平衡集群的多数类下限而不是统一的随机水平进行评分的;词袋基线仅衡量单词同一性。文本预测所有六个发言者的该楼层上方的集群(+0.111 top-3 准确度),但词袋实现了四分之三。句子嵌入仅增加 +0.026,对于未经过句子语义训练的编码器来说是最大的,对于所有其他编码器则通过基于树的探针反转。在任何 360 配置中,声学集群的文本嵌入空间都不紧凑。仅韵律的空间削弱了五个说话者的关联,但不会削弱表现最强烈的说话者的关联。因此,文本主要通过单词选择来告知这些交付集群,无论是作为韵律的提示还是作为主题和记录情况的标记,无参考风格选择不能承担更多。