论文

FlowSteer:通过端到端强化学习进行交互式代理工作流编排

FlowSteer: Interactive Agentic Workflow Orchestration via End-to-End Reinforcement Learning

模型训练智能体系统强化学习Agent HarnessAgentic RL

摘要

近年来,各种强大的代理工作流程已被应用于解决广泛的人类问题。然而,现有的工作流程编排仍然面临关键挑战,包括人工成本高、对特定操作员/大语言模型(LLM)的依赖以及奖励信号稀疏。为了应对这些挑战,我们提出了 FlowSteer,这是一个端到端的强化学习框架,它采用轻量级策略模型作为代理和可执行的画布环境,通过多轮交互自动化工作流程编排。在此过程中,策略模型分析执行状态并选择编辑操作,而画布执行运算符并返回反馈以进行迭代细化。此外,FlowSteer 提供了一个即插即用的框架,支持不同的算子库和可互换的 LLM 后端。为了有效地训练这种交互范式,我们提出了 Canvas 工作流相对策略优化(CWRPO),它引入了具有条件释放的多样性约束奖励,以稳定学习并抑制捷径行为。十二个数据集的实验结果表明,FlowSteer 在各种任务中显着优于基线。

FlowSteer:通过强化渐进式画布编辑迈向由Agent设计Agentic工作流
图1:FlowSteer 框架流程概览。智能体首先根据任务进行初始化并探索搜索空间。随后,通过与人机交互画布的多轮交互,它分析工作流状态、选择编辑动作并接收执行反馈,以迭代地构建和改进工作流。最后,智能体从多样性约束的奖励中学习,在多样任务上持续改进其工作流编排策略。