论文
交错语音语言模型潜在地在文本中工作
Interleaved Speech Language Models Latently Work In Text
摘要
语音语言模型 (SLM) 越来越多地结合语音和文本,通常是通过将它们的标记交错在单个序列中。然而,这两种模式如何在模型的潜在空间中相互作用仍不清楚。在这项工作中,我们使用三种互补方法分析来自不同模型系列和训练配置的交错语音文本 LM。我们发现,这些模型经历了一个隐式的潜在转录阶段,其中与口语单词匹配的文本标记在中间层中变得可解码,尽管没有经过语音识别训练。这种现象发生在不同的自然语音中,并且中间表示也对可能的文本延续进行编码。我们进一步表明,当将文本-语言模型预训练和语音-文本交错相结合时,隐式转录最为出现,并且其流行度与口语事实知识检索呈正相关。我们的分析揭示了交错 SLM 中语音和文本模式之间的内部交互。