论文

使用多模态语言模型检测社交媒体上人工智能生成的内容

Detecting AI-Generated Content on Social Media with Multi-modal Language Models

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

生成式人工智能可以创建逼真的图像和视频,这些图像和视频越来越多地在社交媒体上传播,通常用于垃圾邮件、错误信息、操纵和欺诈。现有的人工智能生成内容(AIGC)检测方法面临挑战,包括对新一代模型的泛化能力差、依赖单一模式以及缺乏可解释的解释。我们提出了通过不断整理不同的多模式社交媒体数据并训练用于检测和解释的紧凑视觉语言模型来缓解这些问题的管道。我们的模型在公共基准上实现了最先进的检测性能,并在跨多个平台的内部社交媒体数据集上展示了强大的检测和解释能力。我们在社交媒体平台上部署了帖子推荐模型,并观察到对用户参与度的积极下游影响,证明在动态、真实的社交媒体环境中执行有效的 AIGC 检测是可行的。