论文
AudioCALM:用于通用音频生成的连续自回归语言建模
AudioCALM: Continuous Autoregressive Language Modeling for Universal Audio Generation
摘要
在一个模型中统一语音、声音和音乐生成受到保真度、端到端训练、上下文条件和可变长度合成之间的权衡的阻碍,而当前的范例还没有完全解决这些问题。为了应对这一挑战,我们提出了 AudioCALM,这是一种通用音频生成框架,它将自回归 (AR) 下一个词元预测从离散词元扩展到连续音频潜在:薄流匹配头取代了 softmax 来预测每个位置的校正流速度,块因果 AR-Flow 注意力模式产生任意长度的输出。多个音频生成任务的联合训练面临着不对称的文本——音频不匹配:语音记录与特定的时间跨度对齐,需要紧密的、时间一致的注意力,而声音和音乐描述仅描述整体语义,依赖于分散的、整体的注意力;将两者混合会不成比例地降低声音和音乐的生成。我们在两个层面上解决这种不对称性:一种数据重构策略,将所有三个任务统一在一个描述式条件接口下;另一种新颖的架构非对称混合模态专家(A-MoME),它为语音添加了一个专用的残差专家,而声音和音乐共享主干,不会对非语音输入产生推理开销。实验结果表明,AudioCALM 符合特定模态的最新技术,并且在语音、声音和音乐生成基准方面优于先前的统一基线。