论文
LLM如何被说服:少数注意力头被改道
How LLMs Are Persuaded: A Few Attention Heads, Rerouted
摘要
可以说服语言模型放弃事实知识。该漏洞对于人工智能安全至关重要,但其内部机制仍知之甚少。我们发现了说服引起的事实错误的紧凑因果机制。一小组中间层注意力头几乎完全决定了模型的答案。这些头将答案选项写入低维多面体,选项占据不同的顶点。说服不会模糊信念或仅仅降低信心;它会导致从正确答案顶点到说服目标顶点的离散潜在跳跃。我们表明决策负责人不会对证据进行推理。相反,他们会复制他们的注意力选择的任何选项标记。说服是通过转移注意力来发挥作用的。我们隔离了控制路由的一级证据路由功能。直接修改此功能会引导模型的选择,而删除它会阻碍说服力。然后,我们将该功能追溯到一组较浅的注意力头,这些注意力头是根据输入中的有说服力的关键字构建的。每一步都通过干预来验证。这种机制出现在开源LLM和现实中毒场景(例如生成引擎优化)中,揭示了说服是一个狭窄的、可监控的电路。
