论文
为什么LLM在策略游戏中陷入困境?观察、信念和行动之间的联系断开
Why Do LLMs Struggle in Strategic Play? Broken Links Between Observations, Beliefs, and Actions
摘要
大语言模型 (LLM) 越来越多地承担在不完全信息下进行战略决策的任务,例如在谈判和政策制定中。虽然 LLM 可以在许多此类任务中表现出色,但它们也以人们知之甚少的方式失败。我们通过开放权重模型 Llama 3.1、Qwen3 和 gpt-oss 实验的支持,揭示了不完全信息博弈中 LLM 决策背后的内部机制中的两个基本差距,揭示了这些失败。首先,观察与信念之间的差距:LLM 对潜在游戏状态的内部表征比他们自己的口头报告准确得多。然而,这些表征(我们按照博弈论术语称为内部信念)是脆弱的。特别是,信念准确性会随着多跳推理而降低,表现出首要性和新近度偏差,并且在扩展交互中偏离贝叶斯一致性。其次,信念与行动的差距:内部信念向行动的隐性转换弱于提示中外化的信念,但两种信念调节都无法始终如一地获得更高的游戏收益。此外,根据解码的信念采取最佳行动将提高大约 95% 的游戏的回报,这表明信念到行动转换的瓶颈。这些结果表明,分析 LLM 的内部流程可以暴露系统漏洞,在没有强大护栏的情况下在战略领域部署 LLM 之前需要谨慎对待。