论文
GS-Codec:神经音频编码的高斯泼溅瓶颈
GS-Codec: A Gaussian-Splatting Bottleneck for Neural Audio Coding
摘要
神经音频编解码器将波形压缩为紧凑的离散token,支撑语音语言模型、实时通信和大规模音频存储。几乎所有主流设计,包括残差矢量量化、有限标量量化和单码本变体,都遵循 VQ-VAE 模板,通过学习的码本或固定标量网格来划分潜在编码器。请问这个分区是否有必要?我们介绍 GS-Codec,一种神经语音编解码器,其瓶颈是参数信号分解而不是量化器。我们将高斯泼溅从 3D 场景重建改编为一维潜变量。内部优化循环将每个编码器段拟合为一维高斯基元的加权和。然后解码器根据渲染的和重建波形。为了避免推理时迭代内循环的成本,我们还训练了一个轻量级 GS Predictor Net,该网络在单次前向传递中回归原始参数。编码器和解码器通过内循环训练端到端,训练管道中的任何位置都没有量化器:瓶颈是分解本身,标量量化仅应用于拟合的后训练到拟合的参数。我们的表示不是依赖离散码本阶段来进行比特率控制,而是公开了细粒度的速率质量权衡:单个经过训练的检查点通过改变基元数量和每个参数位深度来支持后训练比特率控制,无需重新训练。 GS-Codec 在可比比特率下的说话者相似度 (SIM)、清晰度 (STOI) 和感知质量 (UTMOS) 方面可与 EnCodec 和 DAC 等成熟的开源编解码器相媲美或超过,同时实现可比的语义性能 (WER)。代码和音频示例可在 https://ronaluf.github.io/gs-codec/ 获取
