论文

DOA:使用 SpeechLLM 进行长格式同声翻译的 无需训练 仅解码器注意策略

DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs

模型推理解码与生成控制

摘要

同步语音到文本翻译 (SimulST) 在语音仍在展开时生成翻译,需要一个流策略来决定何时读取和何时写入。最先进的方法依赖于基于注意力的编码器-解码器模型,其中交叉注意力提供显式的对齐信号。相比之下,Speech 大语言模型 (SpeechLLM) 是仅依赖于自注意力的解码器架构。这就提出了一个核心问题:解码器自注意力是否包含足够稳定的对齐信号来指导流策略。此外,现有方法通常依赖于基于训练的适应或启发式等待 $k$ 策略,并且尚未在长格式环境中得到验证。为了填补这些空白,我们提出了 Decoder-Only Attention (DOA),这是一种 无需训练 策略,通过从自注意力中导出代理对齐,可以使用现成的 SpeechLLM 进行长格式同步翻译。 Phi4-Multimodal 和 Qwen3-Omni 上的实验表明,DOA 提供了有效的对齐信号来支持流决策,从而实现低延迟长格式 SimulST,其质量接近离线解码,无需重新训练。