论文

具备合理推理能力的AI智能体可证明能在零样本下避免博弈论失效

Reasonably reasoning AI agents can avoid game-theoretic failures in zero-shot, provably

智能体系统Agent 协作

摘要

人工智能代理越来越多地部署在以重复的人工智能交互为特征的交互式经济环境中。尽管人工智能代理具有先进的能力,但实证研究表明,这种相互作用往往无法稳定地产生策略均衡,例如纳什均衡。已提出训练后方法来诱导策略平衡;然而,在战略环境中跨不同的、独立开发的人工智能模型统一应用对齐方法仍然不切实际。在本文中,我们提供了理论和经验证据,证明现成的推理人工智能代理可以实现类似纳什的零样本游戏,而无需明确的后期训练。具体来说,我们证明了“合理推理”智能体,即能够从之前的观察中形成关于他人策略的信念并学习对这些信念做出最佳反应的智能体,最终会以一种弱接近延续博弈纳什均衡的方式沿着几乎所有已实现的游戏路径行事。此外,我们通过允许阶段收益未知以及让每个智能体仅观察其自己私人实现的随机收益来放宽公共知识收益假设,并且我们表明我们仍然可以实现相同的路径纳什收敛保证。然后,我们通过模拟五种游戏场景(从重复的囚徒困境游戏到程式化的重复营销推广游戏)来实证验证所提出的理论。我们的研究结果表明,人工智能代理自然地表现出这种推理模式,因此本质上获得了稳定的平衡行为,从而消除了在许多现实世界的战略交互中对通用对齐程序的需要。