论文
最小化输入端的模态差距:您的语音 LLM 可以是韵律感知文本 LLM
Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM
摘要
语音 大语言模型 (SLM) 通常是根据文本 大语言模型 (TLM) 检查点构建的,但它们仍然存在巨大的模态差距。先前的工作主要试图通过使语音生成更像文本来从输出方面缩小这种差距,但差距仍然存在。我们认为剩下的关键瓶颈在于输入端。我们提出了 TextPro-SLM,这是一种使语音输入更类似于韵律感知文本 LLM 的 SLM。 TextPro-SLM 将 WhisperPro(一种可生成同步文本标记和韵律嵌入的统一语音编码器)与经过训练的 LLM 主干网络相结合,以保留原始 TLM 的语义功能,同时学习副语言理解。实验表明,TextPro-SLM 在 3B 和 7B 尺度上实现了领先 SLM 中最低的模态差距,同时在副语言理解任务上也提供了强大的整体性能。这些增益仅通过大约 1,000 小时的 LLM 训练音频即可实现,这表明减少输入端的模态差距既有效又数据高效。