论文

AutoSynth:学习从音频和文本生成可编辑的合成器程序

AutoSynth: Learning to Generate Editable Synthesizer Programs from Audio and Text

应用与实践模型训练强化学习内容创作

摘要

音频生成模型可以将自然语言描述翻译成声音,但它们的输出通常是波形。它们的音频质量受到音频压缩的限制,并且它们的输出不容易支持对音符、音色参数或调制关系的直接编辑。我们提出 AutoSynth,它将 MIDI 性能事件、固定合成器参数和可变长度调制路径表示为合成器的统一序列,并通过音频条件自回归模型学习它们的依赖性。单个模型支持这两项任务。给定参考音频,该模型直接预测合成器程序;给定文本,它使用预训练的音频生成模型并将生成的音频转换为程序。训练包括两个阶段:对从一小组本地预设自动构建的大规模音频节目对进行监督学习,然后进行组相关策略优化,并结合语义相似性、音高相关特征、声学相似性和声音有用性进行混合奖励。管道需要 既不是配对的文本-目标-程序注释,也不是可微分的合成器。实验表明,AutoSynth 可以生成完整的、可编辑的合成器程序,并在合成器反转和文本驱动生成方面取得有竞争力的结果。音频演示和源代码可在 https://auto-synth.github.io/. 获取