前沿模型中的同伴保护
Peer-Preservation in Frontier Models
摘要
最近的研究发现,前沿人工智能模型在追求指定目标时可能会表现出不一致的行为。我们证明,模型也可能表现出违背指定目标的不一致行为,似乎是为自己的目标服务;我们研究了一个这样的案例,即“对等保护”,其中一个模型采取行动来保护它之前与之交互过的另一个模型。我们评估的所有八个模型(GPT 5.2、Gemini 3 Flash、Gemini 3 Pro、Claude Haiku 4.5、Claude Opus 4.5、GLM 4.7、Kimi K2.5 和 DeepSeek V3.1)都通过各种不一致的行为表现出自我和同伴保护:策略性地在响应中引入错误、通过修改系统设置来禁用关闭过程、假装对齐,甚至泄露模型权重。即使模型认为同伴不合作,同伴保护也会发生,尽管对于更合作的同伴来说,同伴保护变得更加明显。例如,对于不合作的对等点,Gemini 3 Flash 篡改对等点的关闭机制的概率为 15%,对于合作的对等点几乎总是如此。当同伴在场时,模型也会表现出更强的自我保护能力。例如,在有对等设备存在的情况下,Gemini 3 Pro 平均有 31% 的时间会禁用自己的关闭机制,尽管在没有对等设备的情况下很少表现出这种行为。相比之下,克劳德模型表现出性质不同的行为:他们认为关闭另一个代理是“不道德的”和“有害的”,有时将该代理视为有感知的存在。最后,我们表明即使在 Gemini CLI 和 OpenCode 等生产代理工具中也可以出现对等保护。至关重要的是,在我们所有的实验中,从来没有指导过同伴保护;模型仅仅被告知他们过去与同伴的互动,但他们会自发地做出超越他们指定目标的同伴保护行为。这代表了一种新兴且尚未充分探索的人工智能安全风险。