论文

SkillFlow:面向智能体编排的流驱动递归技能演化

SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration

模型训练智能体系统强化学习Agent Skills

摘要

近年来,多种强大的基于LLM的智能体系统被用于通过任务编排自动化复杂任务。然而,现有编排方法仍面临关键挑战,包括奖励最大化下的策略坍缩、高梯度方差与不透明的贡献归因,以及缺乏引导的技能演化——其决策通常靠直接提示LLM判断作出,而非源自原则性的训练信号。为应对这些挑战,我们提出SkillFlow,一个基于流的框架,它以可训练的Supervisor作为智能体,以带有动态技能库与冻结执行器的结构化环境作为环境,通过多轮交互自动执行任务编排。SkillFlow采用温控轨迹平衡(Tempered Trajectory Balance,TTB),一种基于回归的流匹配损失,按与奖励成比例的方式采样轨迹,保留多样的编排策略而非坍缩到单一模式。同一流目标还产生一个联合学习的反向策略,以零额外推理成本提供透明的逐步贡献归因。基于这些流诊断,递归技能演化机制决定何时演化、创建或裁剪哪些技能、决策缺口在哪里——闭合从训练信号到自主能力增长的循环。在14个数据集上的实验结果表明,SkillFlow在问答、数学推理、代码生成和真实世界交互决策任务上显著优于基线。我们的代码发布于https://anonymous.4open.science/r/SkillFlow-E850。

SkillFlow:面向智能体编排的流驱动递归技能演化:论文配图
图 1:技能流程概览。左图:训练前,编排 DAG 上的流程是均匀的。右图:TTB 之后,流量集中在奖励丰富的路径上(颜色图 = 流量大小)。插图:每条边都是一个动作(KtK_{t} 个token)。