论文
PokerSkill:LLM无需训练或求解器即可打出专家级扑克
PokerSkill: LLMs Can Play Expert-Level Poker without Training or Solvers
摘要
扑克是人工智能的一个标志性挑战。主流方法依赖建立在反事实遗憾最小化之上的均衡求解器,需要数百万核时的训练。大语言模型(LLM)拥有丰富的扑克知识,但被要求直接对局时表现远逊于基于求解器的智能体。传统的基于规则的扑克智能体可解释且无需训练,但其策略上限仍远低于均衡打法。我们提出PokerSkill,一个免训练、免求解器的框架,它将细化的基于规则的扑克技能用作LLM的结构化动作落地接口,从而弥合这一差距。一个确定性上下文引擎分析当前状态,并从完全由人类扑克专家设计的分层技能库中仅检索相关片段,将LLM的选择约束在合理动作之内。对阵最先进的GTO基准GTOWizard时,配备PokerSkill的GPT-5.5 XHigh取得 $-57 \pm 21$ mbb/hand,Claude Opus 4.6取得 $-80 \pm 29$ mbb/hand,Claude Opus 4.7取得 $-87 \pm 64$ mbb/hand,相比默认提示基线将损失减少49–61%,并胜过强机器人Slumbot。我们的关键发现是:仅靠规则技能构不成强策略,仅靠LLM也打不好,但二者结合得到的智能体既无需训练也无需访问求解器,却能与其他动用数百万核时计算构建的系统相抗衡。据我们所知,这是首次证明LLM无需游戏专属训练或求解器查询,即可在复杂的不完全信息博弈中取得有竞争力的表现。代码发布于 https://github.com/lbn187/PokerSkill 。