论文

LLM如何被说服:少数注意力头被改道

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

模型评测模型行为与机制分析

摘要

可以说服语言模型放弃事实知识。该漏洞对于人工智能安全至关重要,但其内部机制仍知之甚少。我们发现了说服引起的事实错误的紧凑因果机制。一小组中间层注意力头几乎完全决定了模型的答案。这些头将答案选项写入低维多面体,选项占据不同的顶点。说服不会模糊信念或仅仅降低信心;它会导致从正确答案顶点到说服目标顶点的离散潜在跳跃。我们表明决策负责人不会对证据进行推理。相反,他们会复制他们的注意力选择的任何选项标记。说服是通过转移注意力来发挥作用的。我们隔离了控制路由的一级证据路由功能。直接修改此功能会引导模型的选择,而删除它会阻碍说服力。然后,我们将该功能追溯到一组较浅的注意力头,这些注意力头是根据输入中的有说服力的关键字构建的。每一步都通过干预来验证。这种机制出现在开源LLM和现实中毒场景(例如生成引擎优化)中,揭示了说服是一个狭窄的、可监控的电路。

LLM如何被说服:少数注意力头被改道:论文配图
图 1:有说服力的背景凌驾于事实知识之上。对于同样的问题,模型在干净的输入上正确回答(左),但在添加有说服力的段落时切换到错误的目标(右)。在这里,有说服力的关键词是尼日利亚。