论文

SkillGraph:基于多模态图拓扑的自进化多智能体协作

SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology

智能体系统Agent 协作

摘要

将视觉语言模型扩展为视觉多智能体系统(VMAS)受到两个相互耦合问题的阻碍。其一,通信拓扑在推理前就已固定,对视觉内容与查询上下文一无所知;其二,智能体的推理能力在部署期间保持静止。这两个问题相互强化:僵化的拓扑无法利用更丰富的智能体专长,而静态的智能体也缺乏针对特定查询进行专门化的激励。我们提出SkillGraph来应对这一挑战,这是一个同时进化智能体专长与通信拓扑的联合框架。在该框架中,多模态图Transformer(MMGT)编码视觉token、指令语义与活跃技能嵌入,以预测以查询为条件的协作图,用动态的、内容感知的信息流取代手工设计的路由。与之互补,技能设计器(Skill Designer)从失败案例中提炼并改进推理启发式,构建自进化的多模态技能库(Skill Bank)。关键在于,更新后的技能嵌入被反馈回MMGT,使拓扑能够随能力增长同步适应。实验表明,SkillGraph在四个基准、五种常见MAS结构和四个基础模型上取得一致提升。代码发布于 https://github.com/niez233/skillgraph。

SkillGraph:基于多模态图拓扑的自进化多智能体协作:论文配图
图1:VMAS范式对比:以往采用静态拓扑与冻结技能,SkillGraph以MMGT预测动态协作图、技能库自进化,形成共演化闭环。