论文
PE-Mamba:用于人工智能生成图像检测的双向选择性层聚合
PE-Mamba: Bidirectional Selective Layer Aggregation for AI-Generated Image Detection
摘要
由于生成模型的快速发展以及合成内容和真实内容之间的差距不断缩小,人工智能生成图像(AIGI)检测变得越来越具有挑战性。现有的基于 Transformer 的视觉检测器通常依赖于加权和策略来聚合 Transformer 层的中间表示,通常会忽略分层特征从浅层纹理线索到深层语义表示的固有有序语义进展。在这项工作中,我们提出了 \textbf{PE-Mamba},这是一种基于预先训练的 PE-Core 视觉 Transformer 构建的新颖框架,具有轻量级 LoRA 适配,引入了用于跨层特征聚合和融合的三个互补组件。首先,双向选择性聚合器(BSA)通过前向和后向选择性扫描处理分层分类标记,其中前向扫描逐步积累浅层到深层的取证证据,而后向扫描执行从深到浅的上下文细化,以根据高层语义上下文重新解释底层线索。其次,softmax 加权聚合器 (SWA) 计算所有层标记的学习全局摘要作为补充聚合路径。第三,sigmoid 门控混合 (SGA) 通过可学习的标量门自适应地融合 BSA 和 SWA 输出,使模型能够动态平衡方向顺序证据和全局分层聚合。在 UniversalFakeDetect(96.6\% mACC、99.5\% mAP)和 AIGCDetect(95.3\% mACC、98.1\% mAP)上进行的大量实验表明,\methodname{} 的性能优于 18 个检测器,在不同的生成模型中具有出色的泛化能力,同时仅训练总参数的 1.3\%(仅 LoRA 为 0.13\%)。