论文
FlowSteer:通过端到端强化学习进行交互式代理工作流编排
FlowSteer: Interactive Agentic Workflow Orchestration via End-to-End Reinforcement Learning
摘要
近年来,各种强大的代理工作流程已被应用于解决广泛的人类问题。然而,现有的工作流程编排仍然面临关键挑战,包括人工成本高、对特定操作员/大语言模型(LLM)的依赖以及奖励信号稀疏。为了应对这些挑战,我们提出了 FlowSteer,这是一个端到端的强化学习框架,它采用轻量级策略模型作为代理和可执行的画布环境,通过多轮交互自动化工作流程编排。在此过程中,策略模型分析执行状态并选择编辑操作,而画布执行运算符并返回反馈以进行迭代细化。此外,FlowSteer 提供了一个即插即用的框架,支持不同的算子库和可互换的 LLM 后端。为了有效地训练这种交互范式,我们提出了 Canvas 工作流相对策略优化(CWRPO),它引入了具有条件释放的多样性约束奖励,以稳定学习并抑制捷径行为。十二个数据集的实验结果表明,FlowSteer 在各种任务中显着优于基线。
