论文

EvoSteer:通过参考锚定信用分配进行在线自进化图编排

EvoSteer: Online Self-Evolving Graph Orchestration via Reference-Anchored Credit Assignment

智能体系统Agent 协作

摘要

近年来,基于LLM的多Agent系统已被广泛应用于将使用工具的Agent编排成可执行的通信图。然而,现有的自我进化编排仍然面临着关键挑战,包括事后进化(仅在轨迹结束后才修改团队)、信用扩散(在混杂基线下为每个行动提供相同的终端优势)以及未经校准且从不淘汰的技能准入。为了应对这些挑战,我们提出了 EvoSteer,一种在线自演化图编排的新范式——编排器构建一个正在运行的团队,并根据执行特征和学习的价值估计来修复其看似合理但失败的步骤。为了支持这种范例,我们引入了锚定轨迹平衡(AnchorTB),这是一种回归式的流匹配损失,它通过根据冻结参考平衡子轨迹来为每个编排操作分配一个系数。在学习所得流的基础上,我们进一步提出了“验证技能准入”,即在晋升之前对候选技能进行尝试,并且只有当配对证据在共享名义测试预算下通过序贯检验时才进行晋升。此外,AnchorTB 将测量的任务级参考奖励统计数据与依赖于前缀的修正相结合。十二个数据集的实验结果表明,EvoSteer 在问答、数学推理、代码生成和交互式决策方面显着优于基线。我们的代码可在 https://github.com/beita6969/evosteer. 获取