论文

跨语言语音语言模型的高效训练

Efficient Training for Cross-lingual Speech Language Models

模型训练预训练

摘要

目前,大语言模型 (LLM) 主要关注文本模态。为了实现更自然的人机交互,语音 LLM 正在兴起,但由于数据有限且难以扩展到更多语言,构建有效的端到端语音 LLM 仍然具有挑战性。在本文中,我们介绍了跨语言语音语言模型(CSLM),这是一种基于离散语音标记的跨语言语音 LLM 的高效训练方法。我们提出了一种新颖的对齐策略,通过持续的 预训练 实现跨模式和跨语言对齐。通过在语音文本交错模态链生成过程之后执行指令 微调,我们以更细的粒度增强模态对齐,从而提高生成质量并减少延迟。 CSLM无需大量语音数据即可同时对齐不同的模态和语言,从而表现出良好的语言可扩展性。对跨模态任务、单语会话任务和跨语言会话任务的评估证明了CSLM强大的跨模态对齐能力和通用任务能力。 (代码位于:https://github.com/ictnlp/CSLM)