论文

人工智能代理能否通过学习达到顶峰?评估长期游戏代理竞赛中的启发式学习

Can AI Agents Learn Their Way to the Top? Evaluating Heuristic Learning in a Long-Running Game Agent Competition

智能体系统Agent任务评测智能体自我改进

摘要

对抗性游戏推动了从启发式搜索到强化学习的进步,但从有限的样本中学习和适应策略仍然具有挑战性。人工智能代理通过将游戏体验转化为可执行策略的修订来提供另一种选择。在启发式学习 (HL) 的基础上,我们将对抗启发式学习 (AHL) 形式化,这是一种使用人工智能代理作为学习引擎来完善游戏策略和支持软件,同时保持模型权重固定的范例。我们推出了 AAArena,这是一个基准测试,由 12 个真实的对抗性游戏和 1,920 个存档的人类程序组成,并具有模拟现实世界游戏竞赛的评估协议。代理解释规则、选择对手、分析重播并修改游戏代理,以在固定的比赛和评估预算内实现最高排名。我们评估了 \val{completedmodels} 模型和利用配置:带有 Claude Code 的 Opus5.5 获得了 6 枚金牌,而没有任何评估的配置超过了其余 6 个人类阶梯。在规则规范较复杂的游戏中,性能通常较弱。更远 实验表明,对手的选择和密集的反馈支持策略的改进,并且代理可以从自己比赛的策略重播和其他玩家比赛的策略重播中学习。这些结果凸显了 HL 在对抗性博弈中的潜力,并确定了博弈理解、策略实施和长期政策制定方面持续存在的挑战。