论文
基于声学思想链的 Deepfake 检测音频语言模型
Audio Language Model for Deepfake Detection Grounded in Acoustic Chain-of-Thought
摘要
Deepfake 语音检测系统通常仅限于二元分类任务,并且很难生成可解释的推理或为其决策提供丰富的上下文解释。这些模型主要提取潜在嵌入以进行真实性检测,但未能以有意义的方式利用结构化声学证据,例如韵律、频谱和生理属性。本文介绍了 CoLMbo-DF,一种特征引导的音频语言模型,它通过将强大的深度伪造检测与显式声学思维链推理相结合来解决这些限制。通过将底层声学特征的结构化文本表示直接注入模型提示中,我们的方法将模型的推理基于可解释的证据,并提高了检测准确性。为了支持这个框架,我们引入了一个新颖的音频对数据集以及思想链注释。实验表明,我们的方法在轻量级开源语言模型上进行训练,尽管规模较小,但其性能显着优于现有的音频语言模型基线,这标志着可解释的深度伪造语音检测方面的重大进步。