论文
用于野外无监督语音挑战的多语言语音表示的 BiMamba2 屏蔽离散单元预测
BiMamba2 Masked Discrete-Unit Prediction for Multilingual Speech Representation for Unsupervised Speech in the Wild Challenge
摘要
我们描述了我们在 Interspeech 2026 上向野外无监督语音 (UPS) 挑战赛提交的作品,这是一种双向 Mamba-2 (BiMamba2) 编码器,采用遵循 HuBERT 风格范式的屏蔽离散单元预测进行训练。 47.88M 参数模型使用来自 MLCommons Unsupervised People's Speech 数据集的 67 种语言的 250 小时语音进行训练,没有标记数据。该目标将屏蔽 k 均值伪标签预测与语言识别监督和 VICReg 正则化相结合。根据官方评估,该系统的调整兰德指数为 0.735,超过了说话者聚类的四个基线。语言识别宏 F1 (0.073) 和字符错误率 (0.870) 仍低于监督基线。我们分析了地方官方在度量标准和检查点排名方面的差异,强调了分布内诊断在预测 Dynabench 探测结果方面的局限性。