论文

WER 陷阱:打破语音语言模型中统一标记的幻想

The WER Trap: Shattering the Illusion of Unified Tokens in Speech Language Models

模型评测模型行为与机制分析

摘要

对语音理解和生成的“统一”离散标记的追求导致语音语言模型 (SLM) 社区严重依赖词错误率 (WER)(Whisper 式标记器的核心指标)作为表示质量的最终代理。这促进了这样的假设:低 WER 词元本质上保留了可理解的声音合成所需的信息。我们认为这从根本上来说是欺骗性的。虽然高频词元由于隐式信息泄漏而在生成任务中取得了成功,但以超低帧速率隔离纯语义信息却剥夺了基于 ODE 的生成所必需的细粒度清晰度和微观动力学。根据经验验证这一点需要在不牺牲 WER 的情况下进行极端压缩——这是一个方法瓶颈,因为标准的固定步幅下采样会任意截断语音边界。为了克服这个问题,我们开发了一种动态压缩分词器,可以智能地将表示与语义边界对齐,从而以极低的 WER 实现超低帧速率。使用这些孤立的“纯”语义标记,我们暴露了 WER 陷阱:当调节生成模型时——即使使用预言持续时间对齐——重建的语音也会遭受严重的发音模糊,并且在声音上变得难以理解。我们的研究结果表明,低 WER 奖励的语义分类本质上与合成所需的连续语音轨迹正交,打破了统一标记的幻想,并提倡明确解耦的语音表示。