论文
一个提示就足够了:通过基础图像模型洗水印
One Prompt Is Enough: Watermark Laundering Through Foundation Image Models
摘要
不可见水印通常根据预定义的扰动(例如压缩、模糊、噪声、裁剪和去噪)进行评估。公共基础图像模型暴露了一个明显的威胁:攻击者可以通过单个重建提示提交带水印的图像,并获得视觉上忠实的输出,从中无法再可靠地解码不可见的水印。我们将这种故障模式形式化为水印清洗,并使用联合有效负载保真度配置文件对其进行评估,该配置文件将误码率 (BER) 与视觉和语义保留相结合。在六个 OpenAI 和 Google 图像编辑模型、三个代表性水印方案和 1,800 个重建输出中,我们确定了两种互补的清洗机制:OpenAI 模型在评估方案中产生最强的有效负载破坏,而 Nano Banana 2 显示 DwtDct 在高保真重建下仍然容易受到攻击。及时消融表明,有效载荷破坏不需要单一的面向移除的指令,这表明该效应主要是由重建路径引起的,而不是由明确的攻击措辞引起的。与传统攻击的比较进一步表明,即时条件重建构成了独特的操作攻击界面。这些发现促使基础模型重建成为隐形水印评估中缺失的鲁棒性条件。