论文
ThinkOmni:用于音频伪造检测和定位的推理驱动全模态 LLM 框架
ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization
摘要
现有的音频伪造检测和定位 (AFDL) 方法通常会过度拟合数据集特定的底层伪影,从而限制了它们对微妙、局部和看不见的操作的泛化。最近基于音频 大语言模型 (ALLM) 的方法将 AFDL 视为问答,但仍然隐式地对法医证据进行建模,而不将操作线索与预测联系起来。为了弥补这一差距,我们提出了 ThinkOmni,这是一种推理驱动的全模态 大语言模型,它联合执行显式取证推理、欺骗检测和时间操作定位。为了实现明确的推理监督,我们构建了取证意识链思想(FACoT),这是一个具有结构化取证证据和推理注释的 10 万样本数据集。利用 FACoT,我们引入了取证感知模态增量学习 (FMIL),它逐步将语义、声学和光谱视觉表示与 LLM 主干对齐,以捕获互补的取证线索。我们进一步提出了取证一致性多任务损失(FCML),它将加权交叉熵与自适应定位损失相结合,以协调推理生成、欺骗检测和时间定位。大量实验表明,ThinkOmni 在检测和定位方面都实现了强大的跨数据集泛化。代码、模型、数据和推理示例可在 https://beyond0814.github.io/ThinkOmni/ 上获取。