论文

生成式编辑后潜空间水印的检出存续评测

Latent Watermarks under Generative Editing: A Benchmark and Analysis of Detection Survival

模型评测应用与实践评测方法与指标安全与风险评测内容创作

摘要

如果没有明确定位水印,普通的基于提示的编辑可能会导致潜在水印检测失败。我们针对四个生成主干、四个编辑优势和五个语义类别的五位编辑器对八种水印方法进行了基准测试,并进行了编辑有效性和阈值检查。将编辑与七个后续扭曲分开表明,单独编辑主要区分树轮,而添加的扭曲则暴露了更广泛的检测生存范围。连续编辑揭示了第二个隐藏的差异:分数分离可能会下降,而检测率仍接近上限。在各种方法中,标准化的干净分数分离($d'$)组织了复合生存层,而空间重叠对于预测除干净可检测性之外的仅编辑生存几乎没有什么帮助。两种方法中的嵌入强度干预将更高的干净分离与更高的编辑后分离联系起来。在 HSTR 中,边距对比度为正,而匹配的干净分离处的角度布局对比度仍未解决。一起,结果分解和连续 分离暴露了聚合 TPR 隐藏的差异。在主要操作点和替代复合权重的阈值重新校准下,方法层是稳定的。因此,Clean $d'$ 是此基准中有用的经验诊断,并混合转移到未见过的方法。代码和支持产物计划单独发布。

生成式编辑后潜空间水印的检出存续评测:论文原图
图 2:基准和分析框架。在五个编辑器、四种强度设置和五个编辑类别下评估八种水印方法。检测是在七个单独施加的扭曲之前和之后测量的。低/中/高/最大和偏差箭头指示每个编辑器控制设置的预期进展;最大是测试的最强设置。