论文

LLM能否欺骗图学习?探索文本属性图上的通用对抗攻击

Can LLMs Fool Graph Learning? Exploring Universal Adversarial Attacks on Text-Attributed Graphs

模型评测安全与风险评测

摘要

文本属性图(Text-Attributed Graphs, TAGs)通过为每个节点整合丰富的文本语义和拓扑上下文来增强图学习。在提升表达力的同时,它们也通过基于文本的对抗面暴露了图学习中的新漏洞。近期进展利用多种骨干网络,如图神经网络(GNN)和预训练语言模型(PLM),来捕获TAG中的结构与文本信息。这种多样性引出一个关键问题:如何设计能跨架构泛化的通用对抗攻击,以评估TAG模型的安全性?挑战源于不同骨干——GNN与PLM——感知和编码图模式的方式存在鲜明差异,加之许多PLM只能通过API访问,使攻击被限制在黑盒设定之下。为解决这一问题,我们提出BadGraph,一种新颖的攻击框架,深度激发大语言模型(LLM)对通用图知识的理解,以联合扰动节点拓扑与文本语义。具体而言,我们设计了目标影响者检索模块,利用图先验构建跨模态对齐的攻击捷径,从而实现高效的基于LLM的扰动推理。实验表明,BadGraph在基于GNN与基于LLM的推理器上均实现了通用且有效的攻击,性能下降最高达76.3%,同时理论与实证分析确认了其隐蔽而又可解释的特性。

LLM能否欺骗图学习?探索文本属性图上的通用对抗攻击:论文配图
图1:BadGraph框架总览,展示如何利用LLM构造针对文本属性图的通用对抗攻击以欺骗图学习模型。