论文

更多欺骗:混合动机LLM多智能体系统中的目标失配

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

模型评测安全与风险评测

摘要

由大语言模型(LLM)驱动的多智能体系统正日益被部署于混合动机环境中,在其中智能体因目标冲突或隐藏而在不对称信息与策略性欺骗下运行。在这些场景中,与集体目标的失配成为核心关切。我们提出一个利用社交推理游戏Werewolf评估目标失配的新框架,在保留智能体所分配角色的情况下修改其目标。我们在来自四个不同模型家族与规模、四种玩家角色、三种目标表述的LLM上,对智能体的内部推理与其公开的廉价磋商行为(即无成本、无约束且不直接影响智能体效用的交流)进行双重分析,并以对游戏结果的分析加以补充。我们的结果表明,目标失配会损害本质上对抗性环境中的结果,而不对称信息与专门角色会加剧这一效应。虽然被篡改目标的智能体始终会发展出依赖于目标的独特推理策略,但这些适应在其公开行为中大多不可见。更广泛地说,我们的发现表明,即使细微的目标失配也会深刻影响集体决策,凸显了为基于LLM的多智能体系统制定有效缓解策略的必要性。

更多欺骗:混合动机LLM多智能体系统中的目标失配:论文配图
图 1:对于 Qwen,每个角色有 (a) t-SNE 投影和 (b) 谱聚类混淆矩阵。