论文
口语对话系统基于参考的韵律和节奏评估
Reference-Based Prosody and Rhythm Evaluation for Spoken Dialogue Systems
摘要
语音到语音 (S2S) 人工智能代理正在迅速发展,但评估缺乏针对会话韵律和节奏的可解释的语音原生测量。由于 $F_0$、语速、发音率和停顿变化与模型预测的说话者特征和交互状态有关,因此汇总的人类统计数据可能无法很好地校准以评估特定的输出。使用来自 Seamless Interaction 数据集的 4000 多个小时的二元英语对话,我们构建了 $F_0$ 均值、$F_0$ 表达力、语速、发音速率、停顿率和平均停顿持续时间的匹配参考体系。然后,我们定义一个基于百分位数的评估协议:从 S2S 输出波形中提取相同的指标,将它们与最接近匹配的人类参考层进行比较,并报告百分位数偏差或第 5-95 个百分位数超出范围标志。在保留的人类行中,合并的参考超过了标记状态条件的 $F_0$ 表达性和节奏,而匹配的参考则返回接近标称 10% 的标记率,并使偏差方向可解释。这些输出作为行为合理性检查,补充而不是取代感知和以用户为中心的评估。