论文

LuxSQA:使用 TTS 增强语音问答用卢森堡语问我

LuxSQA: Ask Me in Luxembourgish with TTS-Augmented Spoken Question Answering

模型训练合成数据

摘要

口语问答 (SQA) 仍然主要关注高资源语言和仔细录制的语音,限制了语音 LLM 方法在低资源环境中的覆盖范围。本文研究了文本转语音 (TTS) 是否可以为卢森堡 SQA 提供特定于任务的训练数据,而无需大量人工记录的 QA 语料库。从现有的基于文本的 QA 资源开始,我们将问题翻译成卢森堡语,使用多个 TTS 系统合成口头问题,并将其与文本答案配对。我们训练参数高效的 SLAM 式架构,通过学习投影仪和 LoRA 适配器将冻结的 Whisper 编码器连接到冻结的多语言 LLM 后端。我们比较了 MMS-TTS、Qwen3-TTS 和 OmniVoice 变体,包括约 48k 问题的单源语料库和约 230k 问题的 4TTS 多源混合。使用两个真实的卢森堡说话人条件对 LLAMA-LB-Test 进行的评估表明,多源和基于语音设计的合成训练配置可产生最强的 SQA 性能。结果还表明,无参考 TTS 质量分数不能单调地预测下游 QA 性能,这表明合成语音必须作为特定于任务的训练数据进行评估,而不仅仅是作为听起来自然的音频进行评估。