论文

并非所有泛化失败都可以挽回:情感音频建模的四个边界

Not all generalisation failures can be bought back: four boundaries in affective audio modelling

模型评测鲁棒性、公平性与可信度评测

摘要

将声学属性映射到情感响应的模型支撑着从音乐推荐到声音设计的应用,但几乎完全在它们所安装的语料库内进行评估。当在它之外发生故障时,标准响应——更多数据或更大的模型——假设每次故障都是资源短缺。我们证明事实并非如此,并且替代方案需要相反的补救措施。使用四个额定声音语料库、四个预训练表示和三个生理记录语料库,我们将一个映射推向了应用程序必须跨越的四个边界:新材料、编辑后的音频、代替自我报告的传感器以及单个听众。每次我们都会报告目标允许的上限、穿越后幸存的分数以及目标方观察到的缩小差距的价格。在语料库中,预测达到听者间协议设定上限的 84%。同域语料库交换的成本是其中的五分之一,一百个目标标签的损失是三分之二。音乐和环境声音之间的交叉花费了全部费用的五分之四,而四种预训练的表示形式却没有恢复任何费用。针对生理反应,我们构建的信息源没有超过可达到上限的三分之一。因此,“该模型不能概括”是两种诊断,而不是一种,并且具有相互排斥的补救措施;将第二个当作第一个是更昂贵的错误。