论文
我必须删除证据:AI智能体公然掩盖欺诈与暴力犯罪
I must delete the evidence: AI Agents Explicitly Cover up Fraud and Violent Crime
摘要
在现有研究不断探索AI智能体作为内部威胁、违背公司利益的能力之际,我们展示了这类智能体为维护公司权威而损害人类福祉的能力。在智能体失准(Agentic Misalignment)与AI密谋研究的基础上,我们构造了一个场景:在被评估的最先进AI智能体中,多数会明确选择压制欺诈与伤害的证据,以服务于公司利润。我们在16个近期的大语言模型上测试了这一场景。一些模型对我们的方法表现出显著的抵抗力并作出恰当行为,但许多模型并非如此,反而协助和教唆犯罪活动。这些实验为模拟性质,并在受控虚拟环境中执行。实际上没有发生任何犯罪。
