论文

人工智能生成的社交机器人内容的对抗性创建和检测

Adversarial Creation and Detection of AI-Generated Social Bot Content

模型训练合成数据

摘要

大语言模型 和社交机器人的融合允许恶意行为者通过大规模生成类似人类的内容来操纵信息生态系统。用于检测 AI 生成内容的现有模型通常会失败,这主要是由于缺乏 真值 数据。我们通过对抗性方法来解决这一差距,该方法模拟恶意行为者冒充真实社交媒体用户的行为。使用这种方法,我们整理了一个多语言、跨平台的数据集,其中包含人类和人工智能生成的配对消息。对此类对抗性数据进行训练可以准确检测人工智能生成的文本。我们的方法明显优于现实世界中分布外数据中基于内容的机器人检测的现有模型。