论文
使用音乐理论和声学特征的人工智能生成翻唱歌曲的诊断评估框架
A Diagnostic Evaluation Framework for AI-Generated Cover Songs Using Music-Theoretic and Acoustic Features
摘要
人工智能生成的翻唱通常会因全局质量得分无法定位的局部音乐错误而失败:当伴奏使用错误的和声函数时,声音轮廓可能仍然可识别,或者输出可能保持调性,而编曲仍然不完整。我们提出了一个五维诊断框架,涵盖旋律音高、和声进行、调性一致性、风格一致性和编曲/制作质量。该基准包含 6 个系统从 5 首源歌曲生成的 30 个翻唱,具有专家严重性评级和 9 个符号或声学特征。和声进行和排列的严重错误率最高(53% 和 47%),而调性的一致性得到了更好的保留。六个封面结合了可接受的调性一致性和严重的谐波错误。大跳跃率与旋律评级有名义上的关联(Spearman rho = -0.429,未校正的 p = 0.018),但没有特征相关性在九次测试多重性参考中幸存下来。可解释的百分位规则试点同样未能在 16 个维度级别的比较中可靠地超越固定多数基线。结果将有用的诊断证据与可靠的自动评分分开:低水平和象征性的总结可以暴露特定的症状,但它们不能取代上下文感知的音乐判断。