论文
超越苍白:评估 LLM 训练数据中极端主义言论的流行程度和内容
Beyond the pale: Assessing prevalence and contents of extremist speech in LLM training data
摘要
尽管研究界对可信和安全的人工智能主题抱有浓厚的兴趣,但 大语言模型 (LLM) 在预训练和 后训练 中遇到的文本语料库的组成尚未引起太多关注。在这项工作中,我们解决了 LLM 是否暴露于未经过滤、无语境的极端主义言论的问题。使用源自官方文件和研究文献的极端主义言论的多种定义,以及将自动文本处理与专家验证相结合的提取管道,我们提供了卓玛(支撑 OLMo 系列模型的开放训练语料库)中极端主义文档流行率的下限。我们表明,卓玛可能包含数十万份包含极端主义内容和多种类型仇恨言论的文件,包括直接呼吁暴力,并讨论了这对数据管理和模型 预训练 的影响。