论文

音频语言模型听到和读出的特征是否相似?

Do Audio Language Models Hear and Read Distinctive Features Alike?

模型评测模型行为与机制分析

摘要

音频语言模型通过单个解码器传递语音和文本。我们询问当听到音素和读出音素时,该解码器是否在同一方向上表现出独特的特征。对于在一个特征上不同的最小音素对,我们采用两个成员的平均表示之间的偏移量。对这些偏移进行平均可以得出每个流的方向,然后我们测量两者之间的余弦。由于两个流已经就任意音素对达成一致,因此我们将每个度量与随机配对构建的参考进行比较,而不是与零进行比较。我们将其应用于 11 个系列的 6 个模型、7 个功能和 15 种语言。经过多次测试校正后,只有两个 Qwen2.5-Omni 型号的发声超过了参考值,并且型号之间的参考值相差七倍。在六个模型中的三个中,14 种语言的音频中的语音有一个方向,有足够的最小对来测量它,并且每个语言对在其中两个中一致。模型族(而不是模型大小)预测哪个流代表特征。