论文
E$^3$-Orch:通过强化学习实现有效、高效和可扩展的代理编排
E$^3$-Orch: Towards Effective, Efficient, and Extensible Agentic Orchestration with Reinforcement Learning
摘要
代理编排使多个自治代理能够通过自适应分解、委托和执行来解决复杂的任务。然而,现有的编排器通常依赖于手工设计的逻辑和提示策略,限制了跨任务和执行器配置的适应和泛化。我们提出了 E$^3$-Orch,这是一个基于里程碑-计划-行动工作流程的强化学习框架,用于有效、高效和可扩展的代理编排。 E$^3$-Orch 不是预先规划所有子任务,而是围绕里程碑组织执行,这是一种中层抽象,围绕有意义的中间目标进行规划,并允许编排决策随着执行的进展进行调整。对于每个里程碑,编排器都会构建一个依赖项感知计划,将子任务分配给合适的执行器,并并行执行独立的子任务。我们根据执行反馈来训练编排策略,使用里程碑和计划决策作为细粒度信用分配的单元。树形执行轨迹比较共享执行历史下的替代决策,而补充奖励则优化任务性能、执行成本和规划完整性,包括针对随机下游结果的不确定性感知性能奖励。在七个基准测试中,E$^3$-Orch 在多个执行器配置下实现了最佳任务性能,比最强基线提高了 $0.7$--$3.8$ 点,并提供了 $1.16$--$1.59\times$ 更高的智能效率。学习到的策略还会转移到仅在评估时引入的看不见的执行器配置,支持可扩展的代理编排。