论文

关系合成:结构媒介连接拟音合成与检索增强音频生成

Relational Synthesis: Structure-Mediated Concatenative Synthesis for Foley and Retrieval-Augmented Audio Generation

模型推理解码与生成控制

摘要

我们问:给定检索到的源音频 $S$ 和单独的参考音频 $R$,我们能否从这对 $(S,R)$ 中合成新颖的音频 $Y$,使得 $Y$ 在声学上与 $S$ 保持一致,同时不持久复制 $S$ 或 $R$ 的片段?第一个子句是 Foley 音频制作中的一个众所周知的目标,第二个子句是神经 RAG 中的一个众所周知的问题,即 $S$ 和 $R$ 被简单地注入到神经生成器中。我们证明,可以使用我们创造的关系综合方法同时解决这两个条款,这是串联综合的一种变体,其中目标成本被类似格罗莫夫的关系结构成本取代。关系综合不是模仿 $R$ 的内容,而是从“山的另一边”利用它:它转移 $R$ 的时间结构和定向振幅运动,以一种新颖的方式重新组织和连接 $S$ 的颗粒,从而保护 $S$ 的声学信息。我们的实验表明,关系合成与神经 RAG 自然地集成,并生成 Foley 音频,该音频在测量时间一致性、声学保真度和泄漏持久性的指标上表现良好,同时保持分布级质量和文本对齐。

关系合成:结构媒介连接拟音合成与检索增强音频生成的原论文方法或结果图
图 1:关系合成流程。参考 $R$ 指定时间关系,来源 $S$ 提供可选择的声学材料。方法 $\mathcal{M}$ 把来源声音粒子重新组织到载体 $X_{\mathcal{M}}$ 中;载体与提示 $P$ 一起作为预训练生成器 $G_{\theta}$ 的条件,生成神经输出 $Y$。实验中,$R$ 是与目标 $T$ 配对的声音模仿,$T$ 与 $S$ 属于同一类别。