论文
InstructFX2FX:用于连续音频效果细化的多轮文本转效果系统
InstructFX2FX: A Multi-Turn Text-to-Effect System for Sequential Audio Effect Refinement
摘要
我们推出了 InstructFX2FX,这是一个通过多轮自然语言指令来细化顺序音频效果的系统。现有的文本转效果系统大多是单次的,将一个文本描述符映射到一个预设。真正的音频工程是顺序的:工程师通过连续的指令完善现有的效果链。这提出了单次系统无法解决的状态问题:给定当前效果参数状态和新指令,更新声音,同时保留早期指令已经实现的功能。 InstructFX2FX 通过混合架构解决了这个问题,该架构在语言模型和 CLAP 引导优化之间进行分工。 LLM 充当高级规划器,选择效果并提出初始参数状态,其动机是最近的证据表明 LLM 在单轮文本到效果映射方面可以优于基于 CLAP 的优化;然后,CLAP 引导的优化会细化现有参数状态,提供比 LLM 重新提示更稳定、更稳健的细化机制。在演示中,与会者通过连续的自然语言指令进行干录音:每次转动后,他们选择应用效果的强度,然后根据与他们想要的声音仍然不同的内容发出下一个指令。在对 SocialFX 派生描述符对的初步评估中,CLAP 引导的细化在 10 对中的 9 个上实现了比 LLM+LLM 初始化然后重新提示基线更低的 DSP 功能 MMD。轨迹分析进一步表明,对于可微分的效果,优化往往会逐渐将音频移向新的目标,同时保留先前指令的效果,突出了逐步细化的潜力。