论文
Ti-Audio:支持多方言的藏语端到端语音大模型
Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan
摘要
近年来,语音大语言模型(Speech-LLM)取得了重大进展,大大增强了多模态交互能力。然而,其在资源匮乏和方言多样化环境中的应用仍然面临挑战。藏语数据的严重匮乏,加上其主要方言(卫藏、安多和康巴)之间的语音差异,就是这一挑战的典型例子。本文提出了 Ti-Audio,第一个藏语多方言端到端语音 LLM。为了有效地对齐语音和文本,我们引入了动态 Q-Former 适配器,它可以从可变长度语音中提取基本的声学特征,即使在数据有限的情况下也能确保稳定的跨模态对齐。在数据层面,我们利用相关方言之间的互助来缓解数据稀缺性,并采用基于温度的采样策略来最大化这种协同作用。实验结果表明,Ti-Audio 在自动语音识别和语音翻译的藏语基准测试中实现了最先进的性能。我们的工作验证了跨方言合作的有效性,并为低资源场景下 Speech-LLM 的开发提供了可扩展的范例。