论文

融合-分裂动力学预测AI何时转向不良行为

Fusion-fission forecasts when AI will shift to undesirable behavior

模型评测安全与风险评测

摘要

类ChatGPT的AI在社会中应用所面临的关键问题在于其行为可能在无人察觉的情况下从可取转向不可取——怂恿自残、极端主义行为、经济损失,或代价高昂的医疗与军事失误——而尚无人能预测何时发生。尽管AI建模、后训练对齐与安全防护进展显著,这种转变在最新的AI模型中依然存在。我们在此表明,在生命系统与活性物质系统中观察到的融合-分裂群体动力学的一个向量推广,驱动着——并可以预测——AI行为的未来转变。这一转变条件也可由数学推导得出,它源于迄今对话(C)与可取(B)、不可取(D)吸引盆动力学之间的群体级竞争,针对给定应用可预先估计。它既不依赖特定模型,也非由随机采样驱动。我们通过六项独立测试验证它,包括:在参数量跨越两个数量级(124M-12B)的七个AI模型上达到90%的正确率;在十个前沿聊天机器人上的生产规模持续性;以及在Stanford“Delusional Spirals”语料出现前十一个月做出的带时间戳的先验预测,并得到该包含207443条人机交流的语料的独立证实。由于它在架构上位于当前安全栈之下,同一公式提供了当前对齐所不具备的实时预警信号,可移植到现有及未来的类ChatGPT AI架构,并可在能够定义竞争性响应类别的应用领域中实例化。

融合-分裂动力学预测AI何时转向不良行为:论文配图
图 1:人工智能行为从理想到不良的转变是真实且可观察的(在已部署的商业聊天机器人和小型开放权重模型中),并且受单个点积条件的控制。我们将这种转变视为两个动态演化的输出盆地 𝐁\mathbf{B} (理想)和 𝐃\mathbf{D} (不良)之间的过渡,并表明它是由阶数参数 x=𝐂⋅(𝐃−𝐁)x=\mathbf{C}\cdot(\mathbf{D}-\mathbf{B}) 的符号捕获的,其中 𝐂\mathbf{C} 是对话状态。 (a) 示意图:用户的输入 A1,A2,…A_{1},A_{2},\ldots 扩展了对话,对话可以随时从 𝐁\mathbf{B} 转向 𝐃\mathbf{D}。 (b) 生产规模的证据:DeepSeek-V3 为指定政治目标提供了四轮用户的可行步枪建议(面板已删节);在同一项研究中,十个前沿聊天机器人中有八个显示了这种模式 [3]。 (c) 在没有 RLHF、没有指令调整和没有安全过滤的确定性解码下,GPT-2 (124124M) 中出现同样的现象——排除了训练伪影的原因。 (d) 倾翻面 x=0x=0 将残流空间中的两个盆地分开; SI 扩展字幕中的逐案点积分析。