论文
F3-Tokenizer:驯服音频自动编码器潜在的理解和生成
F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation
摘要
连续音频自动编码器可以很好地重建波形,但通常会产生难以理解的结构较弱的潜在特征,而自监督音频编码器可以捕获语义,但不能直接解码。这种不匹配使必须支持理解和生成的单个音频标记器变得复杂。我们使用两个组件使连续自动编码器潜在适应此设置:噪声正则化自动编码器瓶颈和潜在侧表示编码器。瓶颈使用通道归一化和随机扰动而不是基于 KL 的变分训练,产生用于重建和自回归生成的尺度控制的连续潜伏。表示编码器通过 RQ-MTP 和 freeze-LLM 监督在冻结自动编码器潜伏上进行训练。生成的分词器提供高维表示以供理解,同时保留标准化连续潜在变量作为生成目标