论文
口语模型在阅读文本时会听到语音吗?弥合语音和文本之间的结构差距
Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text
摘要
口语语言模型 (SLM) 直接从语音生成文本响应,为级联系统提供了替代方案。尽管最近取得了进展,但与基于文本的语言模型相比,现有的 SLM 仍然表现出较弱的指令跟踪行为,并且在不同任务中的泛化能力有限。我们的分析表明,尽管下游性能强劲,但当前 SLM 中的语音和文本表示仍然弱对齐,这表明连续、随时间变化的语音和离散文本之间的结构差异仍未得到充分解决。为了解决这个问题,我们提出了一个简单的框架,将长度不匹配与语义对齐分离,并鼓励语音和文本表示之间更紧密的对应。跨多个基准的实验证明了与强大基线相比的竞争性能,强调了在 SLM 训练中明确解决语音和文本之间的结构差异的重要性。我们的代码可在 https://github.com/jaykim9870/Do_SLMs_Hear_Speech_as_ They_Read_Text 上公开获取。