论文
在社交平台上实现负责任的人工智能生成内容:隐写归因和多模式危害检测
Toward Accountable AI-Generated Content on Social Platforms: Steganographic Attribution and Multimodal Harm Detection
摘要
生成式人工智能的快速发展给内容审核和数字取证带来了新的挑战。特别是,良性的人工智能生成的图像可以与有害或误导性文本配对,从而造成难以检测的滥用。这种上下文滥用破坏了传统的审核框架并使归因变得复杂,因为合成图像通常缺乏持久的元数据或设备签名。我们引入了一种支持隐写术的归因框架,该框架在创建时将加密签名的标识符嵌入到图像中,并使用多模式有害内容检测作为归因验证的触发器。我们的系统评估了跨空间、频率和小波域的五种水印方法。它还集成了基于 CLIP 的融合模型,用于多模式有害内容检测。实验表明,扩频水印,特别是在小波域中,在模糊失真下提供了强大的鲁棒性,并且我们的多模态融合检测器实现了 0.99 的 AUC-ROC,从而实现了可靠的跨模态归因验证。这些组件形成了端到端取证管道,可以可靠地跟踪人工智能生成图像的有害部署,从而支持现代合成媒体环境中的问责制。我们的代码可在 GitHub 上获取:https://github.com/bli1/steganography