论文
解释和评估动态速率语音编解码器边界
Interpreting and Evaluating Dynamic-Rate Speech Codec Boundaries
摘要
动态帧率神经语音编解码器用可变持续时间标记替换统一的帧网格,使边界放置成为表示本身的一部分。然而,尚不清楚这些边界编码什么,以及可解释的边界是否也对神经语音重建有用。这项工作通过将预测边界与语言和声学参考进行比较,将边界解释和受控重建分析结合起来。我们发现边界含义取决于底层的语音表示。对于面向 ASR 的 SenseVoice 和 Whisper 编码器,浅层强调语音、发声和声学转换,而更深的层则转向音节和子词结构。在对六种动态帧速率算法和统一(固定帧速率)基线的比较中,较高级别的语言对齐与较低的池化失真和更好的语义标记重建相关。帧速率匹配的边界测试使区别变得具体:音节派生的分区比统一和相似性都有改进,而音素派生的分区则没有比统一有改进。我们推断,对于语义丰富的语音表示,有用的编解码器边界最好理解为围绕音节规模组织的分配决策。