论文
多模态语言模型中的事实回忆机制是否可以从文本转移到语音?
Do Factual Recall Mechanisms Carry over from Text to Speech in Multimodal Language Models?
摘要
近年来,出现了几种联合表示语音和书面文本的语音语言模型(SLM)。接下来的问题是,在两种模式下运行时,模型内部机制有何相似和不同。我们关注这些系统如何编码、存储和检索事实知识,这些知识之前已针对纯文本模型进行过研究。为了研究 SLM 中事实关联的存储和调用背后的机制,我们利用因果中介分析,这是一种先前应用于基于文本的模型的技术。使用 SpiritLM(一种集成离散语音标记的多模态模型)的初步结果揭示了文本到文本和语音到文本结果之间的差异,表明事实回忆的新兴机制仅部分从文本转移到语音模态。这些结果加深了我们对 SLM 中内部机制如何编码事实关联的理解,同时为改进语音人工智能系统提供了见解。