论文
扑克竞技场:LLM中战略推理与记忆的多轴画像
Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs
摘要
不确定性下的战略推理支撑着谈判、金融和政策方面的后续决策,但流行的游戏基准将异构推理维度分解为单一标量,从而使前沿大语言模型的能力结构未经审查。我们推出 Poker Arena,这是一个无限德州扑克锦标赛平台,它将三层内存架构(局内、会话和跨会话)与九轴认知配置文件结合起来,将策略推理分解为可解释的维度,例如下注大小校准和位置意识。我们在 50 个会话(1,000 只手)和受控记忆消融中评估了 7 个前沿模型;锦标赛筹码和总轴得分的顺序不同:Claude Opus 4.6 获胜 + 15,730筹码,14 次获得第一名,但在平均轴得分上仅在七个模型中排名第五,而持久记忆对某些模型有帮助,对其他模型不利。这些发现表明,多轴评估表面的能力结构标量排行榜系统地错误排名,跨维度一致性超过任何单轴上的峰值性能。
