论文
Anysynth:通过上下文学习和非对称分层指导进行零样本仪器克隆
Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance
摘要
零样本乐器克隆旨在渲染任意 [目标 MIDI] 序列,并仅在给定简短的 [参考音频、参考 MIDI] 对的情况下,使用未见过的乐器的声学特性。现有方法依赖于预先训练的嵌入(例如 CLAP),将参考音频压缩为固定长度的向量,从而丢弃了忠实音色重建所必需的细粒度声学线索。我们提出了 Anysynth,一种基于上下文流匹配的无嵌入神经合成器。通过直接在未压缩的参考音频和目标 MIDI 上调节 Diffusion Transformer (DiT),我们的模型允许自我注意力在生成时动态检索声学细节。实验表明,AnySynth 在音频质量、音色相似性和旋律依从性方面优于基于嵌入和自回归的基线。值得注意的是,该模型表现出提示长度缩放:较长的参考提示会稳定地产生更好的音色保真度,这是基于嵌入的系统所不具备的属性。为了优化可控性,我们进一步提出了非对称分层 CFG,它根据 MIDI 和参考音色指导的自然语义声学依赖性在结构上解耦。这种不对称的公式避免了梯度冲突,提高了音符准确性和音色保真度,突破了富有表现力的零样本乐器克隆的界限。演示音频可在 https://anysynth-demo.github.io/ 获取