论文
超越静态评估:对抗博弈中LLM驱动策略演化的共同演化机制
Beyond Static Evaluation: Co-Evolutionary Mechanisms for LLM-Driven Strategy Evolution in Adversarial Games
摘要
LLM 驱动的代码演化的最新进展通过迭代生成和改进程序实现了自动发现。然而,将这些方法应用于对抗性多智能体博弈会带来一个根本性的挑战:随着策略的改进,评估环境会发生变化,导致固定的评估者变得不可靠,进化陷入停滞。我们提出了三种机制来应对这一挑战:评估者共同进化,将发现的冠军纳入对手池;分层深度评估,用统计上可靠的评估取代嘈杂的几场比赛得分;和弱点压力,动态地增加最难突破平台期的对手的权重。我们在 FAMOU 中实现这些机制,FAMOU 是一个基于与 OpenEvolve 和 ShinkaEvolve 相同的基础模型代码演化范式构建的框架。在 MCTF 2026 3v3 海上夺旗任务中,FAMOU 始终优于两个骨干大语言模型的两个基线,取得了最高的综合分数 (0.526) 和对未见过的对手的最佳泛化能力 (61.7% 胜率),而消融则证实了每种机制都有助于提高性能。值得注意的是,LLM 变异过程生成了种子策略中完全不存在的战术结构,包括前向搜索和自适应拦截,这表明代码级进化可以在对抗环境中产生重要的算法创新。 FAMOU 进化策略在 AAMAS 2026 MCTF 竞赛中进一步获得硬件循环赛第一名和模拟赛第三名,验证了其在现实世界中的可迁移性。通过我们的进化过程开发的优化实现和相应的评估代码可在以下网址找到:https://github.com/1xiangliu1/FAMOU-CoEvo
