论文

预训练数据可经计算宣传被投毒

Pretraining Data Can Be Poisoned through Computational Propaganda

模型评测安全与风险评测

摘要

投毒预训练数据可给语言模型引入难以检测与缓解的有害行为。既往对预训练数据投毒的工作大多利用维基百科等既有数据源——不代表预训练语料的典型大规模与异质性,且忽略被投毒数据与数据整理管线之间的交互。我们证明:经由既存的网络规模内容注入机制——公共讨论接口——对预训练数据的投毒攻击在这一受限设定之外是可行的。此外,为度量恶意内容在网页爬取与数据整理后是否被纳入,我们引入HalfLife:一种估计基于网页爬取的LM训练数据中对抗内容纳入的新型分析。我们使用HalfLife探索经开放讨论接口在网络规模上投毒预训练语料的可行性。分析证明估计毒物注入是否被纳入预训练数据的重要性,并确立第三方网页内容作为攻击语言模型预训练的可能载体。

预训练数据可经计算宣传被投毒:论文配图
图 1:攻击向量通过预训练数据管道时的图表。中毒内容通过以下方式进行跟踪:(A) 大规模注入网页,(B) 存在于爬行网页中,(C) 通过语言模型数据开发持久存在,以及 (D) 在用户与经过训练的语言模型交互后重新出现。我们介绍了 HalfLife,这是我们对预训练数据集创建中毒物包含的分析:在 A 阶段注入,然后通过 B 和 C 阶段生存。