论文
基础模型博弈论:通过相似性推断实现理性合作的新路径
A game theory for foundation models shows new paths to rational cooperation through similarity inference
摘要
随着自主智能体,特别是基于基础模型的AI代理,逐渐融入社会和经济系统,理解其集体行为背后的原理对于确保安全与合作至关重要。古典博弈论,作为理性互动的主导框架,建立在“解耦合”假设的基础上,其中代理将自身决策视为独立于环境和他人的外部观察。然而,现代AI代理则同时预测自己的未来行动和外部观测。在这里,我们报告了一个令人惊讶的发现:在处理抽象的社会困境时,基础模型代理进行最优规划时,它们倾向于稳定的合作,直接违背了古典博弈论关于相互背叛的经典预测。为了理解这一现象,我们引入了“嵌入式贝叶斯代理”这一理论模型。通过从解耦合到嵌入式的转变,这些代理将自己视为他们所居住的宇宙的一部分,并保持对自身决策算法的认知不确定性。我们展示了通过评估他人是否行为相似,一个嵌入式代理将其在规划中的决定性思维视为证据:一个合作决策预测了另一个相似的决策者。我们将这一机制通过“嵌入式均衡”这一新颖的解算概念来解释,取代纳什均衡,为现代AI代理的社会行为提供基础博弈论的基础。
