论文

大语言模型为何生成有害内容?

Why Do Large Language Models Generate Harmful Content?

模型评测模型行为与机制分析

摘要

大型语言模型(LLM)已被证明会生成有害内容。然而,这类行为的深层原因仍探索不足。我们提出一种基于因果中介分析的方法,以识别导致有害生成的因果因素。我们的方法在模型层、模块(MLP与注意力块)以及单个神经元等多个粒度上开展分析。在最先进LLM上的大量实验表明,有害生成产生于模型较后的层,主要源于MLP块而非注意力块的失效,并与充当有害生成门控机制的神经元相关。结果表明,模型的早期层用于对提示中有害性的上下文理解,这一理解随后在模型中传播,在较晚的层生成有害性,并通过MLP块传递指示有害性的信号。该信号随后进一步传播到模型的最后一层,具体到达一组稀疏的神经元,这些神经元接收信号并相应决定是否生成有害内容。

大语言模型为何生成有害内容?:论文配图
图 1:CMA 方法概述。基线运行确定有害和无害提示的初始激活和令牌概率。然后使用从无害基线捕获的反事实激活对有害提示进行干预。最后,计算间接效应(IE)以量化组件对模型输出分布的因果影响。