论文
具有大语言模型的通用游戏算法的模块化发现
Modular Discovery of General Game-Playing Algorithms with Large Language Models
摘要
由于游戏类别不同的算法要求和严格的决策时间限制,仅根据规则玩任意游戏仍然具有挑战性。我们是否可以利用大语言模型 (LLM) 来发现通用的游戏算法,而不是针对特定领域手动设计搜索启发式方法?由于语言模型可以提出和重构结构化代码,因此它们提供了一个用于探索算法设计空间的富有表现力的提议引擎。我们引入了多Agent LLM 元学习系统,以共同进化 C++ 中与游戏无关的程序搜索机制以及直接从游戏规则合成的领域启发式方法。为了控制计算预算,我们对 400 多个不同环境中发现的机制进行了基准测试,包括 OpenSpiel 训练和保留游戏、程序模拟引擎以及通过 PPO 训练的具有深度神经策略值表示的游戏。通过 AlphaRank 平稳分布和软孔多塞优化 (SCO) 针对 15 个已建立的 MCTS 基线进行评估,发现的搜索机制在独立进化运行中的大多数基线上始终实现顶级评级和成对投票多数,推广到看不见的人类设计和程序合成的游戏,并与冻结神经网络表示的基线保持竞争力。