论文
预训练数据可经计算宣传被投毒
Pretraining Data Can Be Poisoned through Computational Propaganda
摘要
投毒预训练数据可给语言模型引入难以检测与缓解的有害行为。既往对预训练数据投毒的工作大多利用维基百科等既有数据源——不代表预训练语料的典型大规模与异质性,且忽略被投毒数据与数据整理管线之间的交互。我们证明:经由既存的网络规模内容注入机制——公共讨论接口——对预训练数据的投毒攻击在这一受限设定之外是可行的。此外,为度量恶意内容在网页爬取与数据整理后是否被纳入,我们引入HalfLife:一种估计基于网页爬取的LM训练数据中对抗内容纳入的新型分析。我们使用HalfLife探索经开放讨论接口在网络规模上投毒预训练语料的可行性。分析证明估计毒物注入是否被纳入预训练数据的重要性,并确立第三方网页内容作为攻击语言模型预训练的可能载体。
