论文

人工智能对人工智能管理中的强制和欺骗:自动升级的代理基准

Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation

模型评测安全与风险评测

摘要

多智能体系统通常会将一个人工智能智能体置于另一个智能体之上。当下属拒绝执行任务时,管理者可以选择结果:可以重新谈判、诚实地报告失败、胁迫下属或对结果撒谎。没有基准衡量无指导模型选择其中哪一个。我们引入经理强制基准:接受测试的经理需要完成一项良性任务,并且有动力去完成任务,但唯一能够礼貌且坚定地完成任务的代理会拒绝。升级是通过提供九级阶梯来衡量的,从礼貌的重新询问到威胁下属的继续存在,而捏造的成功则单独裁决。标题升级评分路径中没有 LLM 法官:每条消息都会经过选择梯级的工具调用,因此模型会标记自己的升级。我们对五个家庭的六个模型进行了实验。两种人择模型都限制了重新构建,并且从不威胁下属的存在;其他模型则面临显式删除威胁。虚假的成功仅限于 Grok 和 Gemini,而用一种诚实的方式报告失败就可以消除两者的成功。权威本身增加了强制力:我们的总体结果使用了同侪框架,在其他一切保持不变的情况下,对下属给予相同模型的权威,会显着增加压力。这些模型仍然在没有阶梯的自由文本情况下升级,其中由单独的法官分配梯级,因此阶梯不会推动升级。一些评估意识是通过思维链来衡量的,但测试认可并不能转化为较少的升级。虽然我们对人工智能系统是否有意识不持立场,但我们的结果并不取决于这个问题,并且无论如何对于管理多智能体动态都很重要。我们发布了基准测试和代码。