论文

使用 SpeechLLM 进行流式语音到文本翻译

Streaming Speech-to-Text Translation with a SpeechLLM

应用与实践机器翻译

摘要

通常,将语音翻译成文本的系统由用于语音识别和文本到文本翻译的单独模块组成。将这些任务组合到 SpeechLLM 中有望利用语音中的副语言信息并减少级联错误。但现有的 SpeechLLM 系统速度很慢,因为它们不能以真正的流式传输方式工作:它们在输出翻译之前等待完整的音频发音,或者以固定间隔输出词元,这不适合实际应用。这项工作提出了一种基于 LLM 的架构,用于真正的流式语音到文本翻译。 LLM 不仅学习发出输出词元,还学习确定是否已看到足够的音频来执行此操作。该系统使用输入语音和输出文本的自动对齐进行训练。在不同语言对的实验中,系统实现了接近非流式基线的翻译质量,但延迟仅为 1-2 秒。