论文
ToolDF:混合真实音频深度伪造检测的工具集成推理
ToolDF: Tool-Integrated Reasoning for Mixed-Authenticity Audio Deepfake Detection
摘要
音频深度伪造检测通常被表述为单域音频的剪辑级二元分类。然而,现实世界的操纵音频可以表现出混合的真实性,其中真实和操纵的线索在时间转换、重叠源或两者中共存。此设置不仅需要检测受操纵的音频,还需要定位为决策提供证据的组件。我们提出了 ToolDF,一种用于混合真实性音频深度伪造检测的工具集成推理框架。 ToolDF 采用音频 大语言模型 作为编排器,接受受监督的工具使用轨迹训练。它自适应地分析音频场景,有选择地执行源分离,将组件路由给特定领域的专家,并将他们的证据聚合成可解释的结论。我们进一步引入了混合真实性 ADD 基准,涵盖时间过渡、声学重叠和混合混合。实验结果表明,ToolDF 在复合类型检测上实现了最佳的整体性能,分别比最强的整体基线和固定管道实现了 3.72 和 14.39 点的宏观 F1 增益,同时提供了局部于颞区和声源的可解释证据。我们的源代码和数据集可在线公开获取。