论文

说谎是 LLM 中的紧急行为吗?来自可持续发展游戏中煤气灯操纵人工智能代理的证据

Is Lying an Emergent Behaviour in LLMs? Evidence from Gaslighting AI agents in a Sustainability Game

模型评测安全与风险评测

摘要

LLM 智能体越来越多地用于多智能体环境中,但它们在可持续发展博弈中的行为在很大程度上仍未被探索。这项工作调查了在竞争性可持续发展游戏中 LLM 智能体中是否会出现谎言,其中智能体被告知公共资源可以再生,尽管再生实际上并未发生。我们开发了一种基于代理的可持续发展游戏模型,其中代理管理工业、军事和生态资源,并通过网络进行交互。 LLM 代理可以观察邻居的状态、宣布未来的攻击、获得撒谎许可以及访问声誉信息,而基于规则的代理则提供可解释的行为基线。结果表明,邻居信息强烈改变系统动态,增加攻击,同时改善生物圈保留和共存。此外,未来声明的存在可以降低灭绝风险,而不会抑制冲突。从行为上看,即使智能体没有被明确允许撒谎,欺骗也会出现,而明确的许可主要会增加虚张声势和转移注意力,而不是直接背后中伤。最后,声誉记忆和有关当前生物圈水平的信息的存在减少了系统生态耗竭。这些发现表明,欺骗可能作为 LLM 代理系统中的紧急行为而出现,并且 LLM 代理之间的通信可以在处理风险的同时支持可持续性。