论文
PTCG-Bench:大语言模型特工能精通 Pok\'emon 集换式卡牌游戏吗?
PTCG-Bench: Can LLM Agents Master Pok\'emon Trading Card Game?
摘要
面对策略复杂的桌游,人类玩家只需玩几轮就能快速学会制定策略。自主智能体在真实交互环境中也需要类似能力,但现有智能体基准往往无法充分捕捉此类策略性且不断演化的决策场景。我们提出PTCG-Bench,一个建立在宝可梦集换式卡牌游戏(PTCG)之上的基准,它从两个互补层面评估LLM智能体:(1)在单一复杂环境中的决策表现;(2)通过积累经验进行自我进化的能力。我们进一步引入模块化harness消融,以更好地解释智能体表现而不将其与模型能力混为一谈。实验表明,尽管LLM智能体能够取得不俗的对局表现,持续且稳定的自我进化仍具挑战性,且表现对harness设计敏感。我们希望PTCG-Bench能促进未来在真实交互环境中对harness感知型与自我进化智能体的研究。
