论文

PTCG-Bench:大语言模型特工能精通 Pok\'emon 集换式卡牌游戏吗?

PTCG-Bench: Can LLM Agents Master Pok\'emon Trading Card Game?

智能体系统Agent HarnessAgent任务评测智能体自我改进

摘要

面对策略复杂的桌游,人类玩家只需玩几轮就能快速学会制定策略。自主智能体在真实交互环境中也需要类似能力,但现有智能体基准往往无法充分捕捉此类策略性且不断演化的决策场景。我们提出PTCG-Bench,一个建立在宝可梦集换式卡牌游戏(PTCG)之上的基准,它从两个互补层面评估LLM智能体:(1)在单一复杂环境中的决策表现;(2)通过积累经验进行自我进化的能力。我们进一步引入模块化harness消融,以更好地解释智能体表现而不将其与模型能力混为一谈。实验表明,尽管LLM智能体能够取得不俗的对局表现,持续且稳定的自我进化仍具挑战性,且表现对harness设计敏感。我们希望PTCG-Bench能促进未来在真实交互环境中对harness感知型与自我进化智能体的研究。

PTCG-Bench:LLM智能体能掌握宝可梦集换式卡牌游戏吗?:论文配图
图 1:PTCG-Bench 环境概览。左:神奇宝贝卡示例,注释有关键属性,包括 HP 和类型,以及控制游戏内决策的能力和攻击描述。右图:两人游戏板,每个玩家都有一个活动位置、最多五个替补位置、一个奖品卡区、一个牌库、一个弃牌堆和一手隐藏牌。特工必须对自己可观察到的棋盘状态进行推理,同时推断对手的隐藏信息。