论文

EVOCHAMBER:多智能体系统在个体、团队与种群尺度的测试时协同演化

EVOCHAMBER: Test-Time Co-evolution of Multi-Agent System at Individual, Team, and Population Scales

智能体系统上下文与知识记忆Agent 协作Agent记忆

摘要

我们主张,多智能体测试时演化并非把单智能体演化复制N次。单智能体学习器只能演化自身的上下文与记忆,而多智能体系统还会演化谁与谁协作、如何协作,以及知识如何在种群中流动。这些成分没有单智能体对应物,并能产生诸如涌现式专门化的现象。然而已有的测试时方法要么把经验局限于个体智能体、放弃了跨智能体学习,要么对称地向所有智能体广播,抹去了使协作有价值的专门化。我们提出EVOCHAMBER,一个免训练框架,在一个协同演化的智能体池上于三个层级实现测试时演化。其核心是CODREAM(Collaborative Dreaming,协作式做梦),一个在团队失败或分歧时触发的任务后协议:智能体协作反思、提炼洞见,并将洞见从失败生态位上的强智能体不对称地路由给弱智能体,在填补知识空白的同时保留专门化。团队级算子组装生态位条件化的团队并在线选择协作结构。种群级生命周期算子在性能压力下对智能体进行分叉、合并、剪枝与播种。在使用Qwen3-8B的三个异构任务流上,EVOCHAMBER在竞赛数学上达到63.9%,代码上75.7%,多领域推理上87.1%,在数学上以32%的相对优势超越最佳基线,消融实验确认不对称跨智能体迁移是主要驱动因素。从若干完全相同初始化的智能体出发,四到五个稳定的生态位专家自发涌现,这是单智能体学习器无法表达的多智能体演化结构特征。代码见:https://github.com/Mercury7353/EvoChamber

EVOCHAMBER:多智能体系统在个体、团队与种群尺度的测试时协同演化:论文配图
图 1:EvoChamber 概述。从一组神经网络相同初始化的代理(个体级别)开始,利基条件选择器分配三个功能角色:锚、补充和侦察,领导者学习策略选择四种协作结构之一。团队成果被视为共享奖励(团队级别、任务内)。在任务之间,非对称传输 (CoDream) 将见解从高适应度路由到赤字智能体,生命周期操作员分叉、合并、修剪和播种新智能体以编辑池组成(群体级别、任务间)。