论文

SAGE:高效 LLM 游戏的结构化战略推理

SAGE: Structured Strategic Reasoning for Efficient LLM Game Playing

智能体系统Agent 规划

摘要

一个强大的LLM战略Agent应该对不确定的未来进行前瞻性推理,根据对手的行为倾向调整其策略,并根据互动经验不断重新调整其决策过程。然而,将这些来源纳入自由形式的推理可能会导致不受支持的战略假设、不一致的对手估计以及来自不相关历史相互作用的有害干扰。为了解决这些问题,我们提出了 SAGE,这是一个免训练的推理时间框架,围绕三个协调操作构建 LLM 战略推理:锚定、适应和重新校准。 SAGE 首先将推理锚定到提供战略上有效的先验的均衡策略。然后,它根据对对手行为倾向的软信念来调节与该锚点的偏差,从而实现针对特定对手的利用。最后,SAGE 将战略相关的交互提炼为关于先前缺失的考虑因素的反事实假设,从而允许过去的经验重新校准模型的推理。我们在三种重复的不完全信息游戏上评估 SAGE:Leduc Hold'em、Liar's Dice 和 Goofspiel,每场游戏中针对不同类型的对手。与推理密集型 LLM Agent(包括 Suspicion-Agent、ReTA、Agent-Pro、EMO 和 Hypothetical Minds)相比,SAGE 在 Liar's Dice 中实现了高达 127.6% 的收益提升,同时输入和输出词元使用量分别减少了 80% 和 90%。在直接对决游戏中,它在 Leduc Hold'em、Liar's Dice 和 Goofspiel 中分别针对 5/10、8/10 和 8/10 评估的对手获得非负平均收益,同时使用相对较少的词元。代码可在 https://github.com/chenzhwsysu57/SAGE. 获取