论文
有效地适应新加坡语境的口语模型
Efficiently Adapting Spoken Language Models for the Singaporean Context
摘要
口语模型 (SLM) 统一了语音感知和推理,但将其适应敏感领域的研究尚未充分,特别是当原始训练数据无法访问且用例需要多语言、口语查询交互时。我们将开源 SLM 应用于新加坡主队环境,涵盖新加坡四种官方语言的五个语音任务,结合 LoRA 微调(防止灾难性遗忘的替代文本-QA 数据集)以及将 CoBa 重新加权方案适应语音的多任务目标。我们还构建了 HTD-multilingual-QA,这是一个包含 504,853 个文本和语音形式的多语言 QA 样本数据集。由此产生的 HT-Moonstone (5B) 在大多数任务上与 SLM 相匹配或优于其大小的 7 倍,在所有评估的模型中获得最佳的口音和性别识别,并且损失其原始语音 QA 能力不到 2%。