论文

扑克竞技场:LLM中战略推理与记忆的多轴画像

Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

不确定性下的战略推理支撑着谈判、金融和政策方面的后续决策,但流行的游戏基准将异构推理维度分解为单一标量,从而使前沿大语言模型的能力结构未经审查。我们推出 Poker Arena,这是一个无限德州扑克锦标赛平台,它将三层内存架构(局内、会话和跨会话)与九轴认知配置文件结合起来,将策略推理分解为可解释的维度,例如下注大小校准和位置意识。我们在 50 个会话(1,000 只手)和受控记忆消融中评估了 7 个前沿模型;锦标赛筹码和总轴得分的顺序不同:Claude Opus 4.6 获胜 + 15,730筹码,14 次获得第一名,但在平均轴得分上仅在七个模型中排名第五,而持久记忆对某些模型有帮助,对其他模型不利。这些发现表明,多轴评估表面的能力结构标量排行榜系统地错误排名,跨维度一致性超过任何单轴上的峰值性能。

扑克竞技场:LLM中战略推理与记忆的多轴画像:论文配图
图 1:累积筹码总数为 1,000 手(50 个会话 ×\20 手,每个会话 7 个席位,买入费 1,000 美元)。 Claude 最终获得 16,730 美元,大约是 Grok 第二名 4,705 美元利润的四倍; GPT、DeepSeek、Gemini 和 Qwen 的买入线在 2,000 美元范围内; Kimi 落后于 −$11,558-\$11{,}558。