论文
Thaka 在 KSAA-2026 任务 2:阿拉伯语语音变音符号的正则化 微调
Thaka at KSAA-2026 Task 2: Regularized Fine-Tuning for Arabic Speech Diacritization
摘要
我们描述了 KSAA-2026 阿拉伯语语音听写共享任务任务 2 的获胜系统。该任务需要从语音音频和未区分的文字记录中生成完全区分的阿拉伯文本,只有 2,327 个可用的训练样本,并且不允许使用外部数据。我们的系统对 CATT-Whisper 进行了微调,这是一种字符级多模态模型,将预训练的 CATT 文本编码器与冻结的 Whisper 语音编码器相结合。我们方法的关键是训练正则化:R-Drop 一致性正则化、具有高权重衰减的 Optuna 优化超参数和焦点损失。在推理时,我们使用 Monte Carlo Dropout 在 softmax 概率级别上对四个模型检查点进行 200 次随机前向传递的平均。该系统在主要排行榜指标上达到了 23.26% 的 WER(以案例结尾,包括无变音位置),在所有参与者中排名第一。