论文
用于同步语音翻译的时间感知网络的正则化熵信息自适应
Regularized Entropy Information Adaptation with Temporal-Awareness Networks for Simultaneous Speech Translation
摘要
同步语音翻译 (SimulST) 需要平衡高翻译质量和低延迟。最近的工作介绍了 REINA,这是一种基于估计阅读更多音频的信息增益来训练读/写策略的方法。然而,我们发现基于信息的政策往往缺乏时间背景,导致政策偏向于在开始编写之前阅读大部分音频。我们使用两种不同的策略改进 REINA:监督对齐网络 (REINA-SAN) 和时间步增强网络 (REINA-TAN)。我们的结果表明,虽然两种方法都显着优于基线并解决了稳定性问题,但 REINA-TAN 为流效率提供了稍微优越的帕累托前沿,而 REINA-SAN 提供了针对“读循环”的更强鲁棒性。应用于 Whisper 时,这两种方法都提高了流媒体效率的帕累托前沿(以标准化流媒体效率 (NoSE) 分数衡量),比现有竞争基准提高了 7.1%。