论文
利用 Audio-LLM 过滤语音到语音训练数据
Leveraging Audio-LLMs to Filter Speech-to-Speech Training Data
摘要
大规模挖掘的语料库为端到端语音到语音翻译(S2ST)提供了丰富的训练数据,但可能包含噪声、错位和语义错误。过滤噪声数据对于保持稳健的语音翻译性能至关重要。我们研究如何训练音频语言模型,以直接从音频中对配对语音做出保留/删除决策。为了在没有手动标签的情况下获得可靠的监督,我们采用了可扩展的两阶段“Rank-to-Distill”策略。轻量级排名器从噪声语音对生成保留/丢弃伪标签,然后训练音频 大语言模型 直接从原始配对语音预测保留/丢弃。由此产生的模型联合捕获声音保真度和跨语言语义一致性,以选择语音条件数据。 CVSS-C 和 SpeechMatrix 上的实验表明,与未过滤的训练相比,得到了一致的改进,端到端 S2ST 的 ASR-BLEU 高达 +1.4。