论文

攻破与防御基于LLM的社交媒体机器人检测系统

Breaking and Defending LLM-Powered Social Media Bot Detection Systems

模型评测安全与风险评测

摘要

社交媒体机器人的兴起构成持续威胁,助长虚假信息、舆论操纵,并侵蚀人们对在线平台的信任。为应对这一问题,机器学习系统被开发出来检测和限制机器人活动,但攻击者通过对抗学习、行为模仿等技术不断适应,加剧了机器人与检测工具之间持续的军备竞赛。大语言模型(LLM)的最新进展通过支持对账户及其内容进行更深入的语义与上下文分析,显著改进了机器人检测。然而,这一转变也引入了新的攻击面,使对手能够构造直接针对基于LLM分类器推理与生成机制的利用方式。诸如Anthropic的Claude Code Security等行业工具同样利用LLM做安全关键决策,这进一步凸显了对这类攻击面进行认真研究的必要性。在本工作中,我们同时研究LLM驱动的威胁特定网络安全应用的攻击与防御两面。虽然以社交媒体机器人检测为核心挑战,我们的方法与洞见可推广到广泛的LLM驱动网络安全系统,包括钓鱼检测、邮件分类与欺诈分析。我们提出两种新型对抗攻击策略,系统性地利用基于LLM分类器的语义与上下文弱点,使其检测准确率最多下降48%。为应对这些威胁,我们提出一个鲁棒的多LLM防御架构,旨在自适应对抗条件下保持检测可靠性。我们的方案LSABRE(LLM驱动的社交对抗机器人识别集成)是一个多LLM框架,在一系列攻击下显著提升鲁棒性,在强自适应对抗压力下仍保持86%的检测准确率。

攻破与防御基于LLM的社交媒体机器人检测系统:论文配图
图5:输入防御方法映射