论文

SEAR:音频语言模型的欺骗证据音频推理基准

SEAR: Spoofing Evidence-Grounded Audio Reasoning Benchmark for Audio Language Models

模型评测基准与评测资源

摘要

音频语言模型 (ALM) 越来越多地用于音频深度造假检测 (ADD),但现有基准评估其结论或合理性,而没有验证底层的声学证据。为了解决这个问题,我们首先引入欺骗性基于证据的音频推理 (SEAR),这是一个四任务 AQA 基准,通过声学证据识别和量化、深度伪造检测和取证原理生成来评估基于 ALM 的 ADD。我们进一步提出了一种基于善意的声学证据Agent(BAEA),它在 \textsc{fixed} 或 \textsc{adaptive} 证据获取策略下为冻结的 ALM 配备受控声学工具。六个 ALM 的实验揭示了合理的基本原理和可验证的声学证据推理之间的明显差距,而 BAEA-\textsc{Fixed} 改进了两个评估分区的最终判决和取证基本原理。受控干预进一步表明,误导性证据会降低检测和grounding性能。