论文

通过多智能体自我监督递归自我改进

Recursive Self-Improvement through Multi-Agent Self-Supervision

智能体系统模型训练监督微调与指令调优Agent 协作智能体自我改进

摘要

当模型的输出超出人类专家可以可靠评估的范围时,例如开放式研究等不可验证任务的模型的递归自我改进(RSI)将面临监督瓶颈,从而使模型本身(优化器)成为最佳的可用优化器和评估器。然而,在这种同质循环下,单个模型实例很难批判和改进其自身的复杂推理。为了解决这个问题,我们提出了多智能体自我监督(MASS),这是一种 RSI 方法,它在进化工作流优化和对自生成轨迹的监督微调之间交替。在多智能体拓扑擅长复杂推理的早期发现的指导下,MASS 促使单一基础模型迭代地提出、执行和自我评估多智能体工作流程。通过受结构护栏约束的进化搜索,该模型优化了这些类似计算图的编排,发现针对给定任务的最有效的不同角色和信息路由。使用 Qwen3.6-27B 进行两个 MASS 循环后,该模型的性能提高了 1.2-1.6 倍 四个开放式公共基准上的每个输出token。由于改进后的模型随后充当更好的优化器和评估器,因此这种交替框架可以实现模型功能的连续、递归引导。此外,多智能体跟踪的训练效率也更高:接受多智能体跟踪训练的学生的表现优于接受 1.4 倍多训练token训练的单智能体学生。这些发现表明,从多智能体轨迹中联合学习编排和有界子智能体执行可以为 RSI 提供有效的信号。