论文
用于恶意图像操纵检测的语义水印
Semantic Watermarking for Malicious Image Manipulation Detection
摘要
高保真生成编辑模型的激增使得在普通图像中注入暴力或性内容成为可能,同时保留视觉合理性,这对公共话语和弱势群体产生了具体影响。我们提出了一个强大的语义水印框架,它将水印重新构建为可恢复的语义引用而不是不透明的标识符。我们的框架将基于 $β$-VAE 的二进制水印 (CLIP-VAE) 与显式通道感知训练相结合——在训练期间注入随机位翻转噪声,以便解码器在噪声水印通道下学习优雅的降级。作为下游应用程序,轻量级模块 SDA-Net 使用恢复的语义嵌入来公开图像是否已更改以及在哪个语义方向上已更改。在与代表性二进制哈希基线(SimHash、ITQ、HashNet 及其鲁棒 MLP 变体)的 5 种比较中,CLIP-VAE 在实际 InstructPix2Pix 误码率下实现了与原始 CLIP 嵌入的最高重建余弦相似度,并且独特地支持漂移方向检测 - 对现有内容审核管道的取证补充。