论文

使用采样频率无关的卷积层具有可调节词元时间分辨率的神经音频编解码器

Neural Audio Codec with Adjustable Token Temporal Resolution Using Sampling-Frequency-Independent Convolutional Layers

模型架构新型架构

摘要

从神经音频编解码器(NAC)获得的离散标记已被用作音频生成和理解模型中的紧凑表示。在这种基于词元的系统中,词元时间分辨率(TTR)(定义为相邻词元帧之间的时间间隔)非常重要,因为它控制着表示快速声学事件和减少词元序列长度之间的权衡。然而,大多数 NAC 都是在单个 TTR 上进行训练的,并且需要对每个 TTR 进行单独的训练。本文提出了一种机制,使单个 NAC 使用采样频率无关的卷积层在多个 TTR 下运行。该机制将 TTR 视为词元序列的采样周期,并从共享参数集生成依赖于 TTR 的卷积内核,同时调整每个 TTR 的内核大小和步幅。我们将该机制合并到描述音频编解码器中,保持量化器不变。环境声音重建实验表明,所提出的模型优于为每个 TTR 切换 TTR 特定层的单模型基线。