论文
PermaFrost-Attack:在 LLM 训练期间植入逻辑地雷的隐形预训练播种(SPS)
PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training
摘要
对齐的 大语言模型 (LLM) 仍然容易受到对抗性操纵,并且它们对网络规模预训练的依赖创建了一个微妙但后果严重的攻击面。我们研究隐形预训练播种(SPS),这是一种威胁模型,对手在隐形网站上分发少量有毒内容,从而增加了此类材料被吸收到来自 Common Crawl 等来源的未来训练语料库中的可能性。由于每个单独的有效负载都很小、分散且表面上是良性的,因此在数据集构建或过滤过程中很难检测到攻击。结果是一种潜在的中毒形式,在标准评估下基本上不可见,但随后可以通过精确的触发器(例如<00TRIGGER00>)激活。我们将这种攻击称为 PermaFrost,反映了其潜在的和可重新激活的性质。我们通过 PermaFrost-Attack(潜在概念中毒的受控框架)以及三个几何诊断进行研究:热力学长度、光谱曲率和感染追溯图。在多个模型系列和规模中,我们表明这种受控 SPS 代理可以引发持续的不安全行为,这些行为通常隐藏在标准评估下。我们的结果将 SPS 视为对未来基础模型的实际且未被充分认识的威胁。本文介绍了一种新颖的几何诊断透镜,用于系统地检查潜在模型行为,为检测、表征和理解在标准评估下可能不可见的漏洞提供原则基础。