论文
LLM 能打败纳什吗?在自玩多代理游戏中测试去中心化协调
Do LLMs Beat Nash? Testing Decentralized Coordination in Self-Play Multi-Agent Games
摘要
没有中央控制器部署的 大语言模型 代理通常被认为需要通信来协调其操作。我们问,如果没有它,还有什么可能:当同一模型的独立实例无法通信时,它们是否仍然可以很好地推理其对应对象,以超出不协调游戏的标准博弈论基线?我们引入了一次性、无通信游戏的基准,其中十三种语言模型中的每一种都只被告知其对应模型正在运行相同的模型,并根据基础游戏的纳什均衡进行评估。在跨越七个原型和每个玩家两到十个动作的两人矩阵游戏中,两个前沿托管模型始终超过其纳什基准,在多个原型中接近最佳联合结果,而大多数开放权重模型仅实现部分收益,这些收益因游戏结构而异。在具有四个或更多可互换代理的基于团队的游戏中,性能大幅下降,特别是随着动作空间的增长,这表明在二元游戏中驱动自我博弈收益的任何能力都不会转移到更大的多代理团队。