论文
自组织Agent团队学会共同推理
Self-Organizing Agent Teams Learn to Reason Together
摘要
集体智能不仅取决于团队成员知道什么,还取决于他们如何组织工作。当解的结构未知时,有用的角色与分工无法事先规定;团队必须随推理展开从经验中学习如何组织。人类团队通常如此自适应,而现有AI Agent团队依赖固定协议、显式任务分解或路由。我们提出自组织Agent团队(SAT):固定的AI Agent团队从既往协作中学习可复用策略,以组织角色、对话阶段、参与方式与信息流。这些策略实现了我们所说的协作计算:Agent交换、质疑、修复并综合部分推理,形成没有任何成员能独立产出的解。在两个独立设定中,我们仅用15道数学题与25道研究生水平知识题学习团队策略,并可原封不动迁移到未见基准。在五个数学与物理基准上,自组织团队平均准确率66.7%,而其最强成员为48.8%,该Agent算力匹配推理为58.7%,对成员独立答案的完美路由为59.0%;在AIME 2026上,团队超出该路由13.4个百分点。由于收益在不同基准间存在差异,我们追问自组织协作何时有效。跨八个基准,可判别性(组织心理学构念,指团队能否区分正确与错误推理)与相对最强成员的提升高度相关(Spearman ρ=0.90,p=0.005):当正确推理一旦出现即可被识别时,团队获益最大。更广泛地说,这些结果表明组织本身可以成为一种Agent能力:Agent团队可以学会如何共同推理,产出成员各自无法企及的解。