论文

打破频域水印:调制扩散攻击框架

Breaking Watermarks in the Frequency Domain: A Modulated Diffusion Attack Framework

模型评测安全与风险评测

摘要

数字图像水印在生成人工智能的版权保护方面取得了快速进展,但水印攻击技术的进展相对有限,打破了攻防平衡,阻碍了该领域的进一步发展。在本文中,我们提出了FMDiffWA,一种用于水印攻击的频域调制扩散框架。具体来说,我们引入了频域水印调制(FWM)模块,并将其纳入前向和反向扩散过程的采样阶段。这种机制能够选择性地调制与水印相关的频率分量,从而使FMDiffWA能够有效地中和不可见的水印信号,同时保留受攻击的水印图像的感知质量。为了在攻击功效和视觉保真度之间实现更好的权衡,我们通过用辅助细化约束增强规范噪声估计目标来重新制定传统扩散模型的训练策略。综合实验表明,与现有水印攻击相比,FMDiffWA 实现了卓越的视觉保真度,同时在不同的水印方案中表现出强大的泛化能力。