论文

经共享表示攻击图基础模型

Attacking Graph Foundation Models Through Their Shared Representation

模型评测安全与风险评测

摘要

图基础模型通过把每个输入映射到共享表示、再做任务推理,实现跨图域泛化。我们称这一映射为对齐层——把图基础模型与图神经网络区分开的组件——并证明它是一个既往工作未研究的独立攻击面。我们在推理时攻击它、不接触训练,对象是横跨谱分词器、文本嵌入空间与离散码本的六个公开模型。一个有向的表示空间扰动可使每个模型崩溃,但所需预算与普通图网络也需要的表示范数量级相当;一个例外是OpenGraph:其谱分词器在五分之一的预算下即崩溃——这是普通网络不具备的对齐层特有脆弱性,同表示对照实验把它追溯到分词器而非解码器。一个可实现的输入空间攻击(编辑边、特征或文本)在峰值时移除六个模型中至少三个的一半以上正确预测。输入访问型攻击者能兑现多少这种脆弱性,取决于解码器读取表示的直接程度,而非任务留下的干净准确率;我们结构化地度量这种载体增益——解码器的局部Lipschitz敏感度——并报告干净准确率余量作为模型内排序启发式(在可实现的攻击上不成立)。

经共享表示攻击图基础模型:论文配图
图 1:攻击设置。图基础模型通过由解码器 gg 读取的对齐图 Φ\Phi 将来自任何域的输入映射到一个共享表示。我们在推理时攻击 Φ\Phi,在白盒、灰盒或黑盒知识下,在预算范围内编辑可实现的输入(边、特征或节点和类文本),无需训练访问。因为每个域和模型系列共享这个空间,所以一个扰动会跨域传递,并通过代理跨模型传递。载体(采用 Φ\Phi 的形式)是频谱标记、文本嵌入、码本或通道逻辑。