论文
木马对齐:针对图基础模型的隐形后门攻击
Trojaning the Alignment: Stealthy Backdoor Attacks against Graph Foundation Models
摘要
文本属性图 (TAG) 上的图基础模型 (GFM) 将图表示与语言语义结合起来,以支持可迁移图学习。尽管有这些优点,但 TAG 上的 GFM 后门漏洞仍然没有得到充分理解,特别是在图语言对齐的情况下,其中图和文本表示被训练以在共享语义空间中相互约束。现有的后门攻击主要针对图形侧或文本侧,独立对待这两种模式。这使得直接适应无效:纯图形触发器可能受到干净文本语义的限制,而纯文本触发器会改变语言视图,但不会直接改变正在对齐和评分的图形表示。标签还带来了隐形挑战,因为触发器以节点文本和本地图结构的形式公开,使得不连贯的触发器属性或异常子图易于检查或过滤。在本文中,我们提出了STAG,一种隐形木马攻击框架,专为TAG上的GFM的图形语言对齐接口而设计。 STAG 将图形触发生成器与文本侧软提示进行协调,以便触发器附加的图形表示和触发的文本表示移向相同的目标类文本区域。为了解决特定于TAG的隐秘性,STAG通过候选检索将触发节点实现为可读文本,并对触发附加子图进行正则化,使其局部结构保持接近原始子图。对多个 TAG 数据集和代表性 GFM 的大量实验证明了 STAG 的有效性和隐蔽性。我们的代码可在 https://github.com/ventr1c/STAG 获取。