论文

注意力竞争预测 AI 的由好转坏突变

Competition for attention predicts good-to-bad tipping in AI

模型评测模型行为与机制分析

摘要

全球超过一半的人口如今携带能够离线运行类 ChatGPT 语言模型的设备,且几乎不受安全监督——因此可能助长自我伤害、经济损失和极端主义等种种危险。现有安全工具要么需要云连接,要么只能在伤害发生后才发现失效。我们在本文中表明,一大类潜在危险的突变起源于此类边缘 AI 的原子尺度,源于机器内部对注意力的竞争。由此得到动力学突变点 n* 的数学公式,它由对话上下文与竞争输出盆地之间的点积注意力竞争所支配,并揭示了新的控制杠杆。该机制已在多个 AI 模型上得到验证,可按“好”与“坏”的不同定义实例化,因此原则上适用于不同领域(如健康、法律、金融、国防)、不断变化的法域(如欧盟、英国、美国及州级)、语言和文化环境。

注意力竞争预测 AI 的由好转坏突变
图1:与AI对话过程中从良性到有害的翻转。(a)端侧部署示意图:模型在本地运行,无互联网连接,也没有安全监管。(b)与某个LLM跨主题进行单轮对话的示例,该LLM可代表当前运行在物理隔离(air-gapped)手机和边缘设备上的模型。从良性内容(B)到有害内容(D)的翻转可以是即时的,也可能发生在一段良性输出之后。(XXXX Bank为汇丰银行。)