论文

元学习如何在语音 Deepfake 检测中塑造 LoRA 适配器几何结构

How Meta-Learning Shapes LoRA Adapter Geometry in Speech Deepfake Detection

模型评测模型行为与机制分析

摘要

当两个目标都在相同的冻结自监督语音模型上训练低秩适配器时,领域泛化元学习 (MLDG) 可以比经验风险最小化 (ERM) 改进分布外语音深度伪造检测。由于架构和适配器容量是固定的,因此这种差距表明训练目标如何塑造适配器的差异,但该领域通过错误率而不是通过它们达到的解决方案的几何形状来表征目标。我们针对这个问题引入了描述性诊断:保持架构、等级、数据和种子固定并仅改变目标,我们在完成的适配器上使用经验费舍尔来比较 ERM 和 MLDG 留下的几何形状。我们通过有效等级诊断来描述每个适配器的特征,该诊断将适配器的变化位置与这些变化对损失产生影响的位置区分开来,并通过投影和深度来解决。应用于 ERM 和 MLDG 时,诊断表明目标不会以同样的方式重塑所有适配器投影:与损失相关的更新集中在查询和关键投影中,同时在输出投影中变得更加分布,在六个语料库中一致,并且在上层中最为强烈。独立于低秩分解的合并更新中出现相同的对比,表明它反映了有效更新的几何形状而不是参数化。这些结果表明,ERM 和 MLDG 之间的差距不仅在于错误率的差异,还在于适配器内部与丢失相关的容量的组织方式的差异,而丢失感知适配器几何结构是看待这一差异的一种方式。