论文
混合平衡策略的求解器引导推理
Solver-Guided Reasoning for Mixed-Equilibrium Strategies
摘要
大语言模型 (LLM) 中的推理通常基于人类文本、人类演示和人类生成的基本原理。然而,对于复杂游戏中的均衡推理,依赖人类数据可能不是最理想的。事实上,人类的游戏通常是由直觉和启发法引导的,并且可能会大大偏离游戏平衡。这种差异在混合策略均衡的游戏中会被放大,其中人类数据严重偏向纯策略。因此,根据该数据调整 LLM 会产生较弱的博弈策略。为了赋予 LLM 游戏中的推理能力,在这项工作中,我们研究了如何使用求解器输出来引发均衡游戏。我们提出了混合策略决策树(MDT),它将均衡的无声最优性阐明为人类和 LLM 都可以理解的稀疏策略规则。使用求解器输出而不是人工注释允许我们将输入扩展到任意新的状态和延续。我们通过查询解算器预言机来获取超过 \textbf{2.5 亿个混合策略决策}来实例化这项关于无限注德州扑克的研究; MDT 与其他技术一起 \textbf{在 $8$ 不同的 LLM 配置中将 $\ell_1$ 与均衡的距离减少 $52.6\%$}。仅路线消融测试了基于阴影的对比度的增量贡献,而完整的河牌残局和说谎者骰子实验评估了超出原始 NLH 通信设置的策略保真度和可移植性。