论文
AdaTT:具有目标自适应结构控制的文本引导乐器音色传输
AdaTT: Text-Guided Instrument Timbre Transfer with Target-Adaptive Structural Control
摘要
本文解决了细粒度结构条件下乐器音色传递中的音色模糊性。我们认为这个问题源于这些条件下特定于乐器的表达细节,这与目标音色属性相冲突。例如,将小提琴的音高主导颤音轮廓强加到长笛上,而长笛自然会表现出响度主导颤音,从而损害音色保真度。我们提出了 AdaTT,这是一种目标自适应系统,可确保 ControlNet 方案中不同音色传输场景的高音色保真度。它通过文本提示选择性地缩放音高和响度控制的逐帧影响,以匹配目标乐器的身份。我们还提出了一个半自动数据构建管道来教导模型要转换或保留哪些表达细节。结果表明,AdaTT 实现了卓越的音色保真度和自然度,同时保留了乐谱级别的内容。音频样本可在 https://dabinkim0.github.io/adatt/ 获取。