论文

CTAG-FX:借助语言与音频基础模型把合成器参数转换为音效控制

CTAG-FX: Reinterpreting Synthesizer Parameter Spaces for Expressive Tone-Shaping Audio FX Design

应用与实践内容创作

摘要

最近的文本引导音频 FX 研究重点是将自然语言描述转换为参数或现有 FX 系统中的链配置。然而,对于如何构建单个 FX 处理器的内部控制空间本身,人们的关注相对较少。为了解决这一差距,我们提出了 CTAG-FX,它在功能上重新解释了文本条件合成器配置中 78参数的角色,作为音调整形 FX 处理器的控制。每个合成器配置都定义了一个固定的音调整形处理器,可以重复应用于新的音频输入,而不是仅产生一次性渲染的输出。文本条件合成器配置是使用 A&R-CTAG(CTAG 的检索增强扩展)生成的。我们通过信号级分析以及加扰映射 消融 来评估 CTAG-FX,其中随机排列参数到控制分配以评估所提议的角色分配的贡献。基于角色的映射会产生提示不同的频谱和非线性行为,而置乱则减少了这种提示特定的差异,并产生对提示更加不敏感的非线性配置文件。总的来说,这些结果表明合成器参数空间不仅可以用作声音生成空间,还可以用作构建新的音频效果控制空间的设计资源。音频样本可在 https://taylor3527eg-hub.github.io/ctag-fx-platform-demo/. 获取

CTAG-FX:借助语言与音频基础模型把合成器参数转换为音效控制:论文原图
图 1:代表性的先前文本引导 FX 工作流程。