论文
用于基于 LLM 的通用 Deepfake 语音检测的文本声学基础
Textual Acoustic Grounding for Generalizable LLM-Based Deepfake Voice Detection
摘要
Deepfake 语音检测在未知领域的泛化能力较差。虽然音频 大语言模型 (ALLM) 表现出了希望,但捕获 Deepfake 检测所需的微妙声学细节的连续音频嵌入与 LLM 的语义空间之间的模态差距仍然是一个关键的、尚未充分探索的瓶颈。我们通过对与 Qwen LLM(0.5B 至 7B 参数)集成的各种音频编码器进行基准测试来解决这个问题。首先,我们证明 微调 和 LLM 单独存在域外过度拟合的风险,从而使冻结的 LLM 成为更强大、资源高效的基线。其次,为了明确弥合模态差距,我们引入了一种跨模态提示策略,将语言知识驱动的声学特征(通过 openSMILE)作为结构化文本标记注入。这种明确的文本基础不仅增强了冻结基线,而且使 LLM 微调 更加有效。最终,我们的方法在域外 ITW 和 MLAAD 基准上展示了最先进的弹性,与现有 ALLM 基准相比,在 Macro-F1 中产生了超过 \textbf{16.2\%} 的绝对改进,同时保持了具有竞争力的域内性能。这项工作中报告的所有模型都是 \href{https://huggingface.co/01Yassine/AudioLLM-Deepfake-Detection}{公开可用}。