论文

STAR-VAE:用于音频重建和生成的结构化拓扑感知正则化

STAR-VAE: Structured Topology-Aware Regularization for Audio Reconstruction and Generation

应用与实践内容创作

摘要

连续变分自动编码器 (VAE) 是现代神经音频生成系统的基本连续分词器,可实现高保真重建,同时为下游生成先验提供紧凑、平滑的潜在空间。然而,连续 VAE 面临压缩率、重建保真度和潜在空间拓扑之间的根本冲突,我们将其形式化为速率-失真-规律性三难困境。这种三难困境源于拓扑不匹配:标准 VAE 中的各向同性高斯先验强加了一种平面潜在几何结构,无法适应音频的分层性质,其中低频分量是结构化且可压缩的,而高频分量是随机且不可压缩的,从而导致信息打包无序,其中关键语义特征与高熵噪声交织。为了应对这一挑战,我们提出了结构化拓扑感知正则化(STAR),这是一种通用训练策略,通过施加基于增长的约束场、将结构和纹理信息路由到具有匹配容量的通道子空间来重塑潜在空间几何形状。 STAR 适用于任何 VAE 架构,并有效解决了三难困境,正如基于 CNN 的 VAE 所证明的那样。我们进一步介绍了 STAR-VAE,它将 STAR 与混合 CNN-Mamba 架构相结合,用于局部特征提取和线性复杂性全局上下文建模,以及 STAR-Gen,这是一种基于 LLM 的流匹配框架,利用 STAR-VAE 的结构化潜在空间进行高保真生成,而无需矢量量化伪影。跨不同音频领域的实验表明,STAR-VAE 实现了最先进的重建保真度并增强了语义信息保存,而结构化潜在空间则改进了传统扩散模型和用于文本到音频生成的 STAR-Gen。