论文
ICLAD:用于音频 Deepfake 检测的具有比较指导的上下文学习
ICLAD: In-Context Learning with Comparison-Guidance for Audio Deepfake Detection
摘要
音频深度伪造品构成了重大的安全威胁,但当前最先进的 (SOTA) 检测系统并不能很好地推广到真实的野外深度伪造品。我们引入了一种新颖的 \textbf{I}n-\textbf{C}ontext \textbf{L} 盈利范式,并为 \textbf{A}udio \textbf{D}eepfake 检测(\textbf{ICLAD})提供比较指导。该框架支持使用音频语言模型 (ALM) 将 无需训练 泛化为看不见的深度赝品,并提供有关检测结果的文本原理。 ICLAD 的核心是成对比较推理策略,指导 ALM 发现和过滤幻觉和与深度伪造无关的声学属性。 ALM 与专门的 Deepfake 检测器一起工作,路由机制将分布外的样本提供给 ALM。在野外数据集上,ICLAD 相对于专用检测器改进了宏 F1,相对改进高达 $2\times$。进一步的分析证明了 ICLAD 的灵活性及其在最新开源 ALM 上部署的潜力。