论文
TokenMapper:迈向可互操作语音标记翻译的一步
TokenMapper: A Step Toward Interoperable Speech Token Translation
摘要
神经音频编解码器将语音离散为词元序列,但生成的词元空间在词汇和码本结构上有所不同,从而阻止了跨模型的直接通信。此限制会影响多个语音模型必须交互的应用程序,例如会话语音代理和语音到语音翻译系统。因此,在语音系统之间传输信息通常需要解码为波形音频并使用第二个分词器重新编码,从而增加延迟并引入潜在的信息丢失。为了解决这些限制,我们提出了 TokenMapper,这是一个方向感知框架,用于离散域中异构语音标记器之间的直接标记到标记转换。 TokenMapper 支持结构上不匹配的词元空间,包括在共享有效词元率下单码本和多码本表示之间的映射。 GLM-4-Voice、MiMi 和 DualCodec 上的实验显示了一致的跨模型性能。具体来说,翻译 WER 在 2.5-6.8% 绝对 WER 范围内接近本机重建,TokenMapper 输出的人类 MOS 范围从 2.29 到 4.39,遵循与 UTMOS 相同的方向水平趋势,并且相对于波形桥接,端到端延迟减少了 4.8-94.5%,每个话语高达 972 毫秒。这些结果为跨模型语音词元互操作性提供了实际的一步,无需中间波形重建。