论文

GTO Wizard Benchmark

智能体系统Agent任务评测

摘要

我们推出GTO Wizard Benchmark,一个用于基准测试单挑无限注德州扑克(HUNL)算法的公共API与标准化评估框架。该基准以GTO Wizard AI为对手评估智能体:GTO Wizard AI是一个逼近纳什均衡的最先进超人扑克智能体,曾以19.4 ± 4.1 bb/100的成绩击败Slumbot——2018年年度计算机扑克竞赛冠军、此前最强的公开可用HUNL基准。方差是扑克评估中的根本性挑战;我们通过集成AIVAT来解决,这是一种可证明无偏的方差缩减技术,能以比朴素蒙特卡洛评估少十倍的牌局达到同等的统计显著性。我们在零样本条件下对最先进的大语言模型开展了全面的基准测试研究,包括GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro、Grok 4等。初步结果与分析显示,近年来LLM推理能力取得巨大进步,但所有模型仍远低于我们基准所设定的基线。定性分析揭示了明确的改进机会,包括状态表示以及对隐藏状态进行推理的能力。该基准为研究者提供了一个精确且可量化的环境,用于评估部分可观测多智能体系统中规划与推理能力的进展。

GTO Wizard Benchmark:论文配图
图1:GTO Wizard基准中SB Open场景下GPT-5.3超高推理档位的表现展示。