论文
量化语音文本语言模型中的代模态差距
Quantifying the Generation Modality Gap in Speech-Text Language Models
摘要
纯语音语言模型在生成连贯内容方面通常落后于文本和语音文本语言模型,但这种差距很难量化,因为语音和文本系统通常使用不同的指标进行评估并在不同的数据上进行训练。我们基于连续声学特征生成的流匹配来研究一系列口语模型中的语音文本模态差距。我们构建了一个统一的基于生成的评估套件,该套件比较在匹配的数据分布上训练并在匹配的生成设置中进行评估的纯语音、纯文本和语音文本语言模型。我们沿着多个维度评估生成的延续:语义连贯性,通过转录生成的语音并使用参考语言模型对其进行评分来测量;本地语音结构,通过音素 n 元语法分布统计来测量;说话人的一致性和音质;和基于情感的分布指标。在整个数据集中,我们发现联合语音文本建模大大提高了语义一致性。然而,各个指标的改进并不统一:电话级指标仅发生适度变化,语音文本延续的说话者相似度和预测质量较低,而基于情感的分布指标有所改善。与更大规模的纯语音模型相比,我们的语音文本模型弥补了基于转录本的语义连贯性的大部分缩放差距,这表明文本为口语建模提供了有效的语义训练信号。