论文

类ChatGPT AI的多体倾覆动力学

Many-body Tipping Dynamics of ChatGPT-like AIs

模型评测模型行为与机制分析

摘要

为什么类ChatGPT的AI尽管在架构与训练上差异巨大,却会在确定性的贪婪解码下也意外倾覆到不良内容(如有害、误导、重复)?我们证明,一大类这样的倾覆是由token(自旋)穿越有限层系统时的多体相互作用造成的。倾覆以竞争输出盆地之间的动力学首通过程的形式出现。注意力无序控制着朝向、远离或沿盆地边界的输运。少盆地约化给出一个封闭的有限层阈值,其粗粒化预测在多个类ChatGPT家族间表现出良好一致性。这些结果表明,一大类AI失败属于“可预见的工程风险”,而非本质上不可预测的行为,这对AI危害的法律与社会评估具有重要意义。

类ChatGPT AI的多体倾覆动力学:论文配图
图 1:(a) 转向完整 GPT-2 中的重复输出(顶部);没有 MLP(中);和仅注意(底部)。这表明注意力足以产生小费。然后,MLP/LN 可以通过更改单词并可能改变引爆点来重塑其实现,但它们不会消除纯注意力引爆机制。 (b) 在每一层 tt,Attention 生成自旋-自旋相互作用 (𝖧(t)\mathsf{H}^{(t)}),而 𝖶V(t)\mathsf{W}_{V}^{(t)} 变换每个自旋。 (c) ℓ\ell 层路径扩展:每层要么跳过,要么相互作用,产生 2ℓ2^{\ell} 有序路径和方程中的传播器。 (1). (d) 真实的 GPT 示例显示了这种倾斜效应在句子级别上扩大到意义的倾斜:有关标记的粗粒度,请参阅 End Matter。这些示例适用于低解码温度。