论文
边缘设备上的质量感知自纠错语音翻译
Quality-Aware Self-Correcting Speech Translation on an Edge Device
摘要
我们提出了一个完全离线的语音到语音翻译管道,该管道在 Jetson Nano (4 GB) 上运行,无需重新训练即可纠正其自身的弱翻译。一个 Whisper 微型 ASR 为 Opus-MT 翻译器提供支持;多语言 BERT 余弦相似度充当质量估计 (QE) 门,当置信度低于预定义阈值 $τ$ 时,触发二次传递校正。我们比较了三种校正方法:QE 重排序 (M1)、最小贝叶斯风险解码 (M2) 和约束波束搜索 (M3)。在 1,012 个 FLORES-200 句子(英语-西班牙语)上,$τ=0.90$ 上的 M2 比 BLEU(+0.67,p<0.001)、ChrF(+0.51,p<0.001)和 COMET(N=3 时+0.0020,p=0.002)上的贪婪解码产生了统计上显着的改进; M1 没有产生显着的收益,M3 显着差于基线 (p>0.99)。我们的主要发现是,QE 作为门有效,但作为排序器功能较差:从候选选择 (M1$\to$M2) 中删除 QE 模型不会损害质量,并且可以从关键路径中释放 680 MB 的空间。使用改编自后期编辑工作文献的增益编辑比,我们进一步表明,较小的候选池(N = 3)可以产生更多具有更好语义充分性的外科手术校正,而较大的池(N = 10)可以最大化词汇奖励。我们发布了该系统并演示了六种语言对的实时翻译。
