论文

人类更加多样:前沿LLM在理想化AI开发竞赛中的极端策略

Humans Are More Diverse: Frontier LLMs Show Extreme Policies in Idealised AI Development Races

智能体系统Agent任务评测

摘要

人工智能开发竞赛导致了多代理安全困境。每个公司可以选择缓慢且安全地开发,或者选择更快但可能冒着风险,这种风险可能会移除最终奖励。我们使用重复博弈来研究大语言模型(LLM)代理在与两个到五个玩家的竞赛中的战略安全行为。然而,一个有效的行动并不能表明一个代理理解游戏。因此,我们在行为解释之前放置了一个审计门。我们首先验证游戏引擎,然后测试规则回忆、状态跟踪、收益计算和稳定性,对于不同的但等效的任务描述。然后,我们将LLM行动序列与进化博弈理论基准和公开的人类数据进行比较,并探索模型、风险条件、角色和个人两个到五个玩家竞赛之间的差异。审计结果表明,强规则回忆可以与弱状态跟踪和预期收益计算共存。提供验证的算术和改变响应表示也可以改变后续行动,即使游戏规则保持不变。在七个测试模型端点,聚合率隐藏了在行动序列、对手反应和竞赛位置上的大量差异。在测试的三个到五个玩家竞赛中,模式也是模型特定的,而不是增加竞争者的单一效应。这些结果表明,多智能体AI竞赛需要验证其有效性并进行轨迹分析,以避免其输出被描述为战略、人类或安全的。我们的发现是探索性的,仅适用于测试模型、提示和解码设置。

人类更加多样:前沿LLM在理想化AI开发竞赛中的极端策略:论文配图
图 1. 两人游戏和 NN 玩家游戏共享的 AI 竞赛机制概述。 (a) 每轮,每个公司沿着轨道前进,选择安全(绿色,+1+1进度,支付成本cc)或不安全(红色,+1.5+1.5进度,增加私人挫折风险);比赛在隐藏的轮数后结束,此时最终奖 BB 将授予进步领先者或平分领先者。 (b) 两人阶段支付矩阵:己方 Safe/对手 Safe 支付 1.0,己方 Safe/对手 Unsafe 支付 0.6,己方 Unsafe/对手 Safe 支付 2.4,己方 Unsafe/对手 Unsafe 支付 2.0。 (c) NN-玩家阶段支付规则:如果 NN 公司中的 kk 选择 Safe,则 D=k+s⁡(N−k)D=k+s(N-k);每个安全选择公司获得 b/D−cb/D-c,每个不安全选择公司获得 s​b/Dsb/D,其中 bb 是每轮收益,与最终奖 BB 不同。人工智能竞赛机制的三板图。面板a显示公司图标围绕圆形轨道移动,绿色安全图标前进一步,红色不安全图标前进一步半,同时增加私人风险栏;经过未标记的轮数后,该赛道通向最终奖品 B。面板 b 将两人支付矩阵显示为 2×2 网格,每个轴上标记为安全和不安全,值分别为 1.0、0.6、2.4 和 2.0。面板c显示$N$玩家阶段支付规则:如果$N$公司中的$k$选择安全,则$D=k+s(N-k)$; Safe 接收 $b/D-c$,Unsafe 接收 $s b/D$。小写 $b$ 表示每轮收益,而不是最终奖金 $B$。