论文
类ChatGPT AI的多体倾覆动力学
Many-body Tipping Dynamics of ChatGPT-like AIs
摘要
为什么类ChatGPT的AI尽管在架构与训练上差异巨大,却会在确定性的贪婪解码下也意外倾覆到不良内容(如有害、误导、重复)?我们证明,一大类这样的倾覆是由token(自旋)穿越有限层系统时的多体相互作用造成的。倾覆以竞争输出盆地之间的动力学首通过程的形式出现。注意力无序控制着朝向、远离或沿盆地边界的输运。少盆地约化给出一个封闭的有限层阈值,其粗粒化预测在多个类ChatGPT家族间表现出良好一致性。这些结果表明,一大类AI失败属于“可预见的工程风险”,而非本质上不可预测的行为,这对AI危害的法律与社会评估具有重要意义。
