论文
Dziri Voicebot:阿尔及利亚方言的端到端低资源语音对话系统
Dziri Voicebot: An End-to-End Low-Resource Speech-to-Speech Conversational System for Algerian Dialect
摘要
自动语音和语言技术仍然严重偏向于高资源语言,限制了它们对方言和低资源环境(例如阿尔及利亚方言)的适用性。这种语言带来了额外的挑战,包括缺乏标准化的拼写、与法语的频繁语码转换以及注释语音资源的稀缺。本文解决了为阿尔及利亚方言构建完整的语音到语音会话系统的问题。我们提出了一种模块化管道,将自动语音识别、自然语言理解、检索增强生成和文本到语音合成集成在一个统一的架构中。这项工作是我们之前关于阿尔及利亚方言对话系统 Bechiri 和 Lanasri [2026] 的工作的延续,将其从基于文本的对话建模扩展到完全基于语音的交互。我们为电信领域的 ASR、NLU 和 TTS 构建了专用数据集,并对每个组件的预训练模型进行了微调。 ASR 系统建立在基于 Whisper 的自适应之上,而 NLU 模块则将基于 Transformer 的嵌入与面向任务的对话框架相结合。神经 TTS 系统在新收集的方言语料库上进行训练,以生成口头响应。实验结果表明,所有组件均具有强大的性能,包括 ASR 的低字错误率、NLU 的高意图分类和实体识别分数以及稳定的语音合成质量。所提出的系统为阿尔及利亚方言的端到端会话建模提供了可重复的基线。