论文

拜占庭廉价谈话:LLM 协调博弈中的对抗弹性和拓扑效应

Byzantine Cheap Talk: Adversarial Resilience and Topology Effects in LLM Coordination Games

智能体系统Agent 协作

摘要

多智能体 LLM 系统越来越依赖通信协议进行协调,但它们在对抗性和结构性约束下的鲁棒性仍然知之甚少。之前的工作表明廉价谈话渠道可以在 LLM 协调游戏中实现合作,在此基础上,我们在 6 个模型系列和 720 次试验中调查了 4 人雄鹿狩猎中的两个漏洞类别。首先,当拜占庭Agent发出合作信号但背叛时,非拜占庭Agent在一轮内检测到背叛,但未能集体适应:尽管反复利用,但很大一部分仍继续合作,由于游戏的一致支付结构而无法恢复协调。其次,明确限制通信拓扑会破坏合作,而默默地应用相同的限制则可以保持近乎完美的合作。这表明协调失败源于代理对隐藏信息的元推理,而不是信息丢失本身。我们确定了两种在所有模型群体中复制的稳定行为原型:背叛倾向模型在背叛后永久切换,以及合作持久模型以巨大的个人成本继续合作。这些发现揭示了具体的安全漏洞:通信通道可以被利用作为对抗性注入向量,向代理公开网络拓扑可能会降低协调性,即使没有任何对手在场。