论文

使用 无需训练 多模态 大语言模型 进行语音 Deepfake 检测的 以XAI证据为依据的解释生成

XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models

模型评测模型行为与机制分析

摘要

语音深度伪造检测 (SDD) 系统需要可靠的解释才能做出可靠的决策。现有的解释方式主要分为两类。传统的可解释人工智能(XAI),例如基于梯度的归因,产生与模型决策紧密耦合的底层归因信号,并且比自然语言解释更难被人类理解。同时,由于缺乏启发式证据和特定于任务的监督,基于 大语言模型 (LLM) 的解释生成通常会产生通用且无根据的描述,而这些描述源于有限的 SDD 有根据的解释数据集。因此,我们提出了一个 无需训练 解释框架,它将 XAI 证据与多模态 LLM 相结合,以生成有根据的具体解释。使用 PartialSpoof 数据集,我们构建了一个有根据的解释数据集,并表明使用 XAI 的方法将内部准确性提高了 45% 以上,并通过人工评估和 忠实性 检查进行了验证。