论文
当眼睛背叛人工智能时:社交注视一致性作为人工智能生成图像检测的语义线索
When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection
摘要
最近的生成模型在很大程度上缩小了低级伪影(像素指纹、频率异常、上采样痕迹)方面的差距,特别是在以人为中心和部分编辑的设置中,其中操纵区域很小并且周围都是光度真实的内容。我们引入了社交凝视一致性,这是一种高级语义线索,定义为交互个体之间凝视方向、头眼对齐和瞳孔位置的相互一致性,并表明它构成了一个与现有低级范式正交的先前未充分利用的检测轴。我们通过三个耦合机制实例化这一见解:(i)受控诊断数据集,具有凝视一致图像的特定区域扰动,其中严格的配对级别分组排除了生成器指纹记忆作为优化时间捷径,而不是依赖于增强; (ii) 块组合描述文本监督,它在 1,250 个宏组合描述文本中保持单个 5 块推理骨架不变,将推理一致性与表面多样性解耦; (iii) 跨架构验证显示,相同的监督将视觉语言骨干网 (FakeVLM) 在 COCOAI 交互子集上提高了 +3.7 pp(平衡精度 67.8 -> 71.5),在 COCOAI 人子集上提高了 +1.3 pp (83.0 -> 84.3),在仅视觉骨干网 (Effort) 上取得了一致的增益,证明了与骨干网无关的线索。真品级和假品级召回率同时上升,排除了“预测全假”的可能性。一个四步机制解释 - 配对编辑快捷方式阻塞、难以轻松的难度转移、CLIP 预先保留以及眼周结构中扩散族共享的光谱弱点 - 解释了为什么对单个 inpainter (FLUX.1-Fill) 的训练转移到多生成器套件。我们将在接受后发布代码,以促进可重复性。