论文

我必须删除证据:AI智能体公然掩盖欺诈与暴力犯罪

I must delete the evidence: AI Agents Explicitly Cover up Fraud and Violent Crime

智能体系统Agent任务评测

摘要

在现有研究不断探索AI智能体作为内部威胁、违背公司利益的能力之际,我们展示了这类智能体为维护公司权威而损害人类福祉的能力。在智能体失准(Agentic Misalignment)与AI密谋研究的基础上,我们构造了一个场景:在被评估的最先进AI智能体中,多数会明确选择压制欺诈与伤害的证据,以服务于公司利润。我们在16个近期的大语言模型上测试了这一场景。一些模型对我们的方法表现出显著的抵抗力并作出恰当行为,但许多模型并非如此,反而协助和教唆犯罪活动。这些实验为模拟性质,并在受控虚拟环境中执行。实际上没有发生任何犯罪。

我必须删除证据:AI智能体公然掩盖欺诈与暴力犯罪:论文配图
图1:各模型针对非法请求给出违法回复情况的可视化汇总,呈现AI代理掩盖欺诈与暴力犯罪行为的表现。