论文
融合-分裂动力学预测AI何时转向不良行为
Fusion-fission forecasts when AI will shift to undesirable behavior
摘要
类ChatGPT的AI在社会中应用所面临的关键问题在于其行为可能在无人察觉的情况下从可取转向不可取——怂恿自残、极端主义行为、经济损失,或代价高昂的医疗与军事失误——而尚无人能预测何时发生。尽管AI建模、后训练对齐与安全防护进展显著,这种转变在最新的AI模型中依然存在。我们在此表明,在生命系统与活性物质系统中观察到的融合-分裂群体动力学的一个向量推广,驱动着——并可以预测——AI行为的未来转变。这一转变条件也可由数学推导得出,它源于迄今对话(C)与可取(B)、不可取(D)吸引盆动力学之间的群体级竞争,针对给定应用可预先估计。它既不依赖特定模型,也非由随机采样驱动。我们通过六项独立测试验证它,包括:在参数量跨越两个数量级(124M-12B)的七个AI模型上达到90%的正确率;在十个前沿聊天机器人上的生产规模持续性;以及在Stanford“Delusional Spirals”语料出现前十一个月做出的带时间戳的先验预测,并得到该包含207443条人机交流的语料的独立证实。由于它在架构上位于当前安全栈之下,同一公式提供了当前对齐所不具备的实时预警信号,可移植到现有及未来的类ChatGPT AI架构,并可在能够定义竞争性响应类别的应用领域中实例化。
