论文

抽象代理

Abstraction Agent

模型推理推理策略与问题分解

摘要

信息抽象将战略上相似的私有状态分组到易于处理的数量的桶中,对于将博弈求解算法扩展到大型不完美信息游戏至关重要。然而,构建有效的抽象传统上需要特定领域的评估器,例如手力计算器或权益估计器,这需要专业知识和工程工作,并且对于大多数研究较少的游戏来说是不可用的。我们提出了抽象代理,这是一种零样本管道,它使用 大语言模型 (LLM) 从自然语言游戏描述中发现连续的策略特征,对这些特征的私有状态进行评分,并将它们聚类到抽象桶中,而在抽象构建期间无需任何特定于游戏的评估器、训练数据或游戏树遍历。该管道分四个阶段运行:使用校准锚点进行特征发现、批量私有状态评分、基于相关性的特征选择和 $k$ 均值聚类。相对于单挑无限注德州扑克 (HUNL) 回合残局的预期手牌强度基线,由此产生的抽象可将提升策略的可利用性降低高达 62%,并且在 ROVER Trials(任何预训练语料库中都没有的原始游戏)的每个粒度上都击败了标量排名基线。除了这些定量基准之外,管道以不变的提示转移到四张底池限注奥马哈、HUNL 翻牌前和翻牌圈以及立直麻将,其中发现的功能跟踪每个游戏公认的战略概念。这就是结构化知识获取:将 LLM 参数中隐含的策略知识转换为显式的数值特征,以供下游算法计算。该代码可在 https://github.com/lbn187/AbstractionAgent 获取。