论文
证明:无需训练 使用可验证证据快速恢复
PROVE: Training-Free Prompt Recovery using Verifiable Evidence
摘要
现代文本到图像模型可以根据自然语言提示生成高度逼真的图像,而提示反转的最新进展使得从生成的输出中恢复这些提示变得越来越可行,引发了对版权保护和内容所有权的新担忧。随着提示市场的出现,恢复的提示可以实现未经授权的复制和重新分发受版权保护的创意作品,以及在人工智能生成的内容中编码艺术家创意配方的提示的曝光。现有的提示反演方法依赖于基于梯度的优化、自回归字幕或强化学习。然而,基于优化的方法通常会产生不可读的提示,字幕方法会产生未经验证的细节,而基于强化学习的方法经常会过度拟合特定的生成器,同时引入评估循环。我们引入了 PROVE(带有已验证证据的提示恢复),这是一种 无需训练 黑盒提示反转攻击,它通过编写可验证的场景描述而不是优化词元序列来重建提示,针对原始版权作品和人工智能生成的内容。由此产生的提示是完全可审计的,每个恢复的声明都基于明确的图像证据,并通过精确约束的召回最大化目标来形式化。在 MS-COCO、Flickr30K 和 Lexica 中,使用最先进的文本到图像生成器,PROVE 在图像相似性(DINO、LPIPS)和文本图像对齐(CLIP)方面始终优于优化、字幕和基于 RL 的基线,无需任何训练、生成器访问或 微调,展示了更强大、更实用的提示反转攻击。