论文

ViP-VL:具有矢量量化学习的越南语自监督语音预训练模型

ViP-VL: Vietnamese Self-supervised Speech Pretraining Model with Vector-Quantization Learning

模型训练预训练

摘要

我们提出了 ViP-VL,这是一种利用矢量量化学习的高效越南语自监督语音预训练模型。为了弥补高分辨率音频和高效处理之间的差距,ViP-VL 结合了声学堆叠和感受野对齐,以在 ChunkFormer 架构内实现同步 8 倍子采样率,同时在 BEST-RQ 框架上进行预训练期间通过专门的掩模选择策略进一步增强表示稳健性。我们的模型经过 17,000 小时未标记的越南语语音的预训练,在四个主要下游任务中建立了新的最先进的结果:自动语音识别、语音情感识别、方言分类和说话人验证。为了促进高性能越南语语音技术的未来研究和开发,我们在 github.com/khanld/chunkformer 公开发布了我们的预训练权重和实现。