论文

LLM 是否需要对同步语音翻译进行架构更改?前缀到前缀数据驱动方法

Do LLMs Need Architectural Changes for Simultaneous Speech Translation? A Prefix-to-Prefix Data Driven Approach

模型训练监督微调与指令调优

摘要

同步语音翻译 (SimulST) 需要在严格的延迟限制下进行增量翻译,但由于上下文和跨语言重新排序有限,对于仅解码器的 LLM 系统来说仍然具有挑战性。最近的方法经常引入架构更改或显式读/写策略来控制输出时序,这在分段边界不明确的会话语音中可能很脆弱。我们提出了一个简单的数据驱动替代方案:用于累积流解码的固定长度块,具有基于倒带的提交前缀,以及教师标记的前缀到前缀(P2P)目标,具有有限等待微调,产生CSSEL-P2P,其中CSSEL是我们提出的分块流语音编码器LLM。在我们的内部会话语音评估中,CSSEL-P2P 在可比较的延迟(+0.15 秒平均滞后)下将流质量比 CSSEL 流基线提高了 +1.54 COMETKiwi,这表明通过 P2P 监督无需进行架构更改即可实现有效的 SimulST。