论文

测量和减轻 大语言模型 的毒性:综合复制研究

Measuring and Mitigating Toxicity in Large Language Models: A Comprehensive Replication Study

模型评测安全与风险评测

摘要

在网络规模的语料库上训练的 大语言模型 (LLM) 本质上会从训练数据中吸收有毒模式。这会导致有毒的退化,即使是无害的提示也会触发有害的输出。这种现象给现实世界的部署带来了重大风险。因此,需要有效的缓解策略,在确保安全的同时保持模型的实用性。在这项全面的复制研究中,我们评估了 DExperts(解码时间专家)的功效,这是一种推理时间缓解技术,可以在不需要模型重新训练的情况下引导生成。我们将研究分为三个系统阶段:(1) 在标准 GPT-2 模型上使用 RealToxicityPrompts 建立基线毒性测量;然后 (2) 实施和评估 DExperts 以减轻显性毒性;最后 (3) 使用对抗性 ToxiGen 数据集对隐式仇恨言论的方法进行压力测试。我们的实证结果证实,虽然 DExperts 在显性毒性基准上实现了近乎完美的安全率 (100%),但它在对抗性、隐性仇恨言论方面表现出脆弱性,安全率降至 98.5%。此外,我们量化了一个关键的权衡。该方法引入了 10 倍的延迟损失(从每代 0.2 秒到 2.0 秒),给实时部署场景带来了挑战。这项研究通过强调显式和隐式毒性缓解之间的鲁棒性差距,为人工智能安全方面不断增长的工作做出了贡献。我们强调需要更复杂的方法来概括不同的仇恨言论模式,而不会产生过高的计算成本。