论文
融合是新的突变:多臂老虎机引导的工作流图进化
Fusion is the New Mutation: Bandit-Guided Evolution on Workflow Graphs
摘要
自动化Agentic工作流程优化依赖于昂贵的评估,因此有效分配有限的评估预算至关重要。多亲本融合可以重用以前发现的工作流程中的设计,但识别有前途的亲本组合需要从有限的融合反馈中学习。我们引入了 DAGO(有向非循环图优化),这是一个上下文多臂老虎机引导框架,可以学习在有限的评估预算下融合哪些父工作流程。 DAGO 将每个候选父组合制定为一个手臂,由其组成工作流程的代码和提示的预训练嵌入表示。对角线 LinUCB 策略学习跨臂的共享奖励模型,并平衡具有高预测后代质量的臂的开发与不确定性驱动的探索。选择手臂后,LLM通过摘要引导融合生成子工作流程,子工作流程的验证分数作为更新老虎机的奖励。共享的有向非循环图维护已发现的工作流程及其多父辈血统,为后续的手臂提案提供了不断扩大的父辈池。在涵盖数学推理、代码生成和问答的六个基准中,DAGO 在评估的基准中获得了最高的宏观平均得分。在匹配的验证评估预算下,它比 AFlow 从 80.3 提高到 81.7,同时将总搜索支出减少了 11.2%。 消融研究表明,LinUCB 引导的臂选择优于随机选择及其无探索变体,支持反馈驱动选择和探索-利用平衡的价值。
