论文
Q-SPT:用于低帧率语音标记的可学习的基于查询的压缩
Q-SPT: Learnable Query-Based Compression for Low-Frame-Rate Speech Tokenization
摘要
神经语音编解码器越来越多地充当语音语言模型 (SLM) 的分词器。降低帧速率可以降低 SLM 的计算和内存成本,但很难同时保留语言信息和声学细节。现有方法依赖于基于规则的压缩:平均池化可以丢弃语言信息,而基于相似性的合并使用相邻帧相似性的固定阈值并将所得边界应用于声学流。我们提出了 Q-SPT,一种低帧率双流语音标记器,具有独立的、上下文感知的、可学习的基于查询的压缩器,专门用于语义和声学表示。特别是,以固定速率进行的查询独立地将语义流和声学流作为单独的键值源,从而通过两个单独学习的压缩器实现特定于流的上下文感知聚合。此外,自回归文本丢失明确监督语义压缩器以保留语言信息。实验结果表明,Q-SPT 在相同帧速率下评估的编解码器中实现了最佳重建。在下游 SLM 中,它可以产生最佳的语音识别精度和文本到语音的感知质量,并具有具有竞争力的清晰度。