论文

解锁语音文本组合能力:无需指令调整的指令跟随语音语言模型

Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning

模型优化模型合并

摘要

语音语言模型 (SLM) 的指令调整比基于文本的 大语言模型 (LLM) 更具挑战性,因为除了文本 LLM 支持的指令之外,它还需要学习新的模式和广泛的特定于语音的指令。现有的 SLM 训练方法通过合成大规模语音 预训练 和指令调整数据集,在很大程度上复制了文本 LLM 训练范例。然而,这种策略很难扩展,因为语音序列比文本序列长得多。在本文中,我们提出了 SpeechCombine,这是一种无需任何指令调整即可训练的指令跟踪语音语言模型,仅在 30k 小时的数据上使用单轮语音 预训练。从文本 LLM 基本模型开始,我们对语音话语执行连续的 预训练 以获得语音适应模型,然后直接将其权重与文本 LLM 的指令调整版本和基本版本之间的权重差异相结合。我们的结果表明,这种简单的组合策略不仅保留了原始文本 LLM 的知识和能力,而且还有效地将它们转移到语音领域。这些发现为 SLM 训练提出了一个新方向,避免依赖海量语音数据。