论文
潜在音频扩散用于历史古琴录音的听觉迭代研究
Adapting a Latent Audio Diffusion Model to Historical Guqin Recordings: A Listening-Driven Case Study
摘要
我们报告了一个小数据案例研究,将预训练的潜在音频扩散模型应用于古琴(七弦古筝),旨在打造一个不间断播放古琴风格音乐的“人工智能收音机”。我们从历史录音库中策划了 412 场独奏表演(42.5 小时,61 名表演者),并按作曲进行分类。我们在 Stable Audio 3 Medium 上使用微调进行 16 级 DoRA 适配器,使用其连续的 潜变量、针对连续性加权的掩蔽、将每首作品的研究笔记与情绪标签和自动估计的五声音模式相结合的字幕、以及随机长度裁剪,当 保留测试 损失停止改善时停止。一位专家听众进行的七项盲听研究指导了每一个决定。最终的适配器在未见过的连续片段方面获得最高评分(3.9/5,而早期最佳适配器的评分为 3.4),在根据自由编写的场景描述生成方面获得了 4.6/5 的评分。负面结果同样提供了丰富的信息:同一 潜变量 上的从头开始的自回归模型没有产生可识别的音色,信号级摩擦噪声测量与听众在错误方向上的抱怨相关,而五声音阶拟合测量则跟踪总体评级,但几乎只在一组候选者中进行。长时间播放的链接延续会在每个生成的剪辑上暴露出无声尾部和响度反馈循环,这两个问题都可以通过简单的修复来解决。对于一名听众和每种条件最多十个剪辑,配对差异不具有统计显着性;我们提出了一份探索性记录,说明什么有帮助,什么没有帮助,以及原因。