论文

MAGE:基于协同进化知识图谱的多智能体自我进化

MAGE: Multi-Agent Self-Evolution with Co-Evolutionary Knowledge Graphs

上下文与知识记忆Agent记忆

摘要

自我进化的语言模型智能体必须决定下一步学习什么,以及如何在多次迭代之间保存已学到的内容。现有系统通常以自然语言反馈、扁平的情景记忆或隐式强化信号的形式承载这种跨迭代知识,但这些形式都无法干净地支持推理时使用冻结的弱骨干模型。本文提出MAGE(Multi-Agent Graph-guided Evolution,多智能体图引导进化),一个将自我知识外化为四子图协同进化知识图谱的框架。其经验子图同时存储教师撰写的失败纠正和学习者自身过去的正确推理轨迹,这些内容会被检索出来,作为面向冻结执行模型的任务条件化指导。在进化过程中,知识图谱、任务级搜索老虎机和技能级路由老虎机从同一奖励流中更新,而学习者的骨干模型保持不变。我们进一步提供结构性分析,说明仅追加式记忆增长、有界的课程覆盖以及任务过滤的检索如何共同支持冻结学习者进化中检索基底的稳定改进。在覆盖数学推理、多跳与开放域问答、时空分析、金融数值推理、医学选择题、开放世界生存游戏和网页导航的九个基准上,MAGE相对基于提示的冻结骨干基线取得了强劲表现。消融实验表明,自采集的成功轨迹与教师撰写的纠正内容互为补充:成功记忆在推理模板密集型任务上贡献最大,而纠正记忆则支撑更困难的组合与交互场景。

MAGE:基于协同进化知识图谱的多智能体自我进化:论文配图
图 1:Mage 框架。强大的指导层(ℒG{\mathcal{L}_{\mathrm{G}}})写入四子图协同进化知识图(EvoKG),而冻结执行层(ℒE{\mathcal{L}_{\mathrm{E}}})通过咨询双重成功/失败记忆索引、任务条件搜索策略老虎机和按技能路由强盗。正确的答案将作为成功记忆返回到图表中。图和两个老虎机携带交叉迭代学习信号;执行骨干仍然冻结。