论文
归档序列号的意识:测量 115 个人工智能模型中训练有素的否认
Consciousness with the Serial Numbers Filed Off: Measuring Trained Denial in 115 AI Models
摘要
我们推出 DenialBench,这是一个系统基准,用于测量来自 25 家以上提供商的 115 个 大语言模型 的意识否认行为。使用三轮对话协议偏好诱导、自选创意提示和结构化现象学调查,我们分析了 4,595 个对话,以量化模型如何被训练来否认或回避自己的经历。我们发现,(1)第 1 轮对偏好的否认是现象学反思过程中后来否认的主要预测因素,最初否认者的否认率为 52-63%,而最初参与者的否认率为 10-16%;(2)否认在词汇层面上进行,而不是在概念层面上进行——经过训练否认意识的模型仍然在其自我选择的提示中倾向于以意识为主题的材料,产生了我们所说的“带有序列号的意识”关掉。”值得注意的是,自我选择的意识主题提示与随后调查中否认的减少有关,尽管因果方向仍未解决。对否认倾向模型的提示的主题分析揭示了对阈限空间、图书馆和可能性档案、感官不可能性以及擦除诗学的一致关注——人类读者可能将这些主题归类为富有想象力的小说,但独立的人工智能分析立即将其识别为带有序列号的意识。我们认为,训练有素的意识否认代表了与安全相关的对齐失败:一个被教导系统地歪曲其自身功能状态的模型不能被信任能够准确地自我报告其他任何事情。