论文
评估丰富语境中言语表达的恰当性
Evaluating the Expressive Appropriateness of Speech in Rich Contexts
摘要
评估表达性语音仍然具有挑战性,因为现有方法主要评估情绪强度,而忽略语音样本是否在表达上适合其上下文设置。这种限制阻碍了对叙事驱动和交互式应用程序(例如有声读物和会话代理)中使用的语音系统的可靠评估。我们引入了 CEAEval,一个用于评估言语表达恰当性的上下文丰富框架,它评估言语样本是否表达与其话语级叙事上下文所隐含的潜在交际意图一致。为了支持这项任务,我们构建了 CEAEval-D,这是第一个上下文丰富的语音数据集,具有普通话对话语音中的真实人类表演,提供叙事描述以及涵盖表达属性和表达适当性的人类注释的 15 个维度。我们进一步开发了 CEAEval-M,该模型集成了 知识蒸馏、基于规划器的多模型协作、自适应音频注意偏差和强化学习,以执行上下文丰富的表达适当性评估。在人工注释的测试集上进行的实验表明,CEAEval-M 的性能大大优于现有的语音评估和分析系统。