论文
从平面语言标签到类型先验:多语言语音到语音翻译的结构化语言调节
From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation
摘要
基于语音 大语言模型 (SpeechLLM) 构建的组合语音到语音翻译 (S2ST) 系统最近表现出了良好的性能。然而,现有的 S2ST 系统通常要么忽略源语言信息,要么通过语言即标签范式对其进行编码,将每种源语言表示为独立的平面嵌入。这种设计忽略了跨语言共享的系统语言结构,当监督 S2ST 数据稀缺时,这可能会限制数据高效的多语言适应。为了解决这个问题,我们提出了 S2ST-Omni 2,这是一个多对一的组合 S2ST 框架,它系统地重新制定了从平面语言标签到结构化类型先验的多语言语言调节。具体来说,S2ST-Omni 2 在三个层面重新审视了语言调节:用于结构化源语言表示的类型学信息分层语言编码、用于内容自适应声学调制的动态门控语言感知双 CTC,以及用于解码器端语言指导的类型学感知 LLM 提示。 CVSS-C 上的实验表明,在采用的评估协议下,S2ST-Omni 2 在 BLEU、COMET、ASR-BLEU 和 BLASER 2.0 的代表性 S2ST 方法中实现了优异的平均性能。消融研究表明,所提出的表示级、声学级和解码级策略提供了互补的优势。此外,受控数据预算分析和仅使用大约 3 小时监督训练数据的日语到英语评估表明,明确的类型学先验为数据高效的多语言 S2ST 提供了有用的归纳偏差。