论文

Digital Red Queen:基于 LLM 的 Core War 对抗程序进化

Digital Red Queen: Adversarial Program Evolution in Core War with LLMs

模型推理推理搜索与路径规划

摘要

大语言模型(LLM)正被越来越多地用于以受生物进化启发的流程来为众多领域进化出问题解决方案。然而,与生物进化不同,大多数 LLM 进化框架被表述为静态优化问题,忽视了真实世界进化过程所具有的开放式对抗动态。本文研究 Digital Red Queen(DRQ),一种简单的自博弈算法,它通过持续适应不断变化的目标来接纳这种所谓的“红皇后”动态。DRQ 使用 LLM 进化被称为 warrior 的类汇编程序,它们在 Core War 游戏中相互竞争以争夺一台虚拟机的控制权;Core War 是一个在人工生命领域被研究、并与网络安全相关联的图灵完备环境。在 DRQ 的每一轮中,模型进化出一个新 warrior 以击败之前所有的 warrior,从而产生一序列持续适应的 warrior。经过许多轮之后,我们观察到 warrior 相对一组留出的人类 warrior 变得越来越通用。有趣的是,不同独立运行之间的 warrior 行为多样性也在下降,这表明存在向通用行为策略收敛的压力,类似于自然界的趋同进化。这一结果凸显了从静态目标转向动态红皇后目标的潜在价值。我们的工作将 Core War 定位为一个丰富且可控的沙盒,可用于研究人工系统中的对抗适应并评估基于 LLM 的进化方法。更广泛地说,DRQ 的简单性和有效性表明,类似的极简自博弈方法在其他更实用的多智能体对抗领域(如现实世界的网络安全或对抗耐药性)也可能有用。

Digital Red Queen:基于 LLM 的 Core War 对抗程序进化 配图
图 1:概览。数字红皇后(Digital Red Queen, DRQ)利用大语言模型(LLM)进化称为“战士”(warriors)的汇编程序,这些程序在 Core War 游戏中相互竞争以争夺虚拟机的控制权。左上:由人类设计的两个经典战士示例。战士以 Redcode 汇编语言编写,然后被置入虚拟机,其指令与其他战士一同执行。每个战士都试图通过使对手崩溃而成为最后一个仍在运行的程序。右上:执行期间虚拟机内存的可视化。符号表示指令操作码,颜色表示最后修改每个地址的战士。代码与数据共享同一地址空间,这使得自我修改变为可能,并为战士营造了一个易变的环境。左下:DRQ 相继各轮的适应度曲线。后来的战士针对此前所有战士进行训练。右下:示意图,表明 DRQ 的不同独立运行所产生的战士在行为上趋于一致,同时整体上变得更加稳健。