论文
LLM距离职业扑克玩家有多远?以Agentic工具使用重审博弈论推理
How Far Are LLMs from Professional Poker Players? Revisiting Game-Theoretic Reasoning with Agentic Tool Use
摘要
随着大语言模型(LLM)日益应用于高风险领域,其在不确定性下进行策略推理的能力变得至关重要。扑克提供了一个严格的测试平台,不仅需要强力行动,还需要有原则的博弈论推理。本文对LLM在多个真实扑克任务上进行系统研究,同时评估对局结果与推理轨迹。我们的分析揭示LLM无法与经典算法竞争,并识别出三种反复出现的缺陷:依赖启发式、事实性误解,以及知行差距——行动偏离推理。行为克隆与步级强化学习的初步尝试改善了推理风格,但仍不足以支撑准确的博弈论对局。受这些局限启发,我们提出ToolPoker,一个工具集成推理框架,它结合外部求解器实现GTO一致的行动,并给出更精确的职业风格解释。实验表明,ToolPoker取得最先进的对局表现,同时产生的推理轨迹紧贴博弈论原则。
