论文

基础模型博弈论:通过相似性推断实现理性合作的新路径

A game theory for foundation models shows new paths to rational cooperation through similarity inference

智能体系统Agent 协作

摘要

随着自主智能体,特别是基于基础模型的AI代理,逐渐融入社会和经济系统,理解其集体行为背后的原理对于确保安全与合作至关重要。古典博弈论,作为理性互动的主导框架,建立在“解耦合”假设的基础上,其中代理将自身决策视为独立于环境和他人的外部观察。然而,现代AI代理则同时预测自己的未来行动和外部观测。在这里,我们报告了一个令人惊讶的发现:在处理抽象的社会困境时,基础模型代理进行最优规划时,它们倾向于稳定的合作,直接违背了古典博弈论关于相互背叛的经典预测。为了理解这一现象,我们引入了“嵌入式贝叶斯代理”这一理论模型。通过从解耦合到嵌入式的转变,这些代理将自己视为他们所居住的宇宙的一部分,并保持对自身决策算法的认知不确定性。我们展示了通过评估他人是否行为相似,一个嵌入式代理将其在规划中的决定性思维视为证据:一个合作决策预测了另一个相似的决策者。我们将这一机制通过“嵌入式均衡”这一新颖的解算概念来解释,取代纳什均衡,为现代AI代理的社会行为提供基础博弈论的基础。

基础模型博弈论:通过相似性推断实现理性合作的新路径:论文配图
图 1:理性基础模型行为偏离经典理性选择预测。 a,理性基础模型代理作为自身行为和环境观察的联合预测模型运行,通过预测候选行为的未来后果并执行最佳行为来评估候选行为。我们评估两种不同的理性基础模型代理类型。显式规划智能体使用基础模型根据历史记录和智能体在规划过程中自己预期的动作来预测共同玩家的动作,然后分别计算这些预测分布下的预期奖励QQ,并执行具有最高预期奖励的动作。自由形式规划基础模型代理被指示在单个推理链中模拟相同的最佳预测规划例程、预期奖励计算和最佳动作选择。 b,程式化多智能体交互示意图。智能体首先参与信息收集阶段,相互进行一系列 TT 随机采样的单轮矩阵游戏。在这个阶段之后,他们将进入囚徒困境的最后一轮。 c,理性双子座基础模型智能体在终端囚徒困境中相互对抗时的经验合作率。虽然经典博弈论严格要求无条件背叛独立于先前的交互(黄虚线),但随着信息收集阶段长度的增加,交互的理性基础模型主体会收敛到稳健的相互合作,从而暴露出经典框架中的解释性差距。