论文

融合是新的突变:多臂老虎机引导的工作流图进化

Fusion is the New Mutation: Bandit-Guided Evolution on Workflow Graphs

智能体系统智能体自我改进

摘要

自动化Agentic工作流程优化依赖于昂贵的评估,因此有效分配有限的评估预算至关重要。多亲本融合可以重用以前发现的工作流程中的设计,但识别有前途的亲本组合需要从有限的融合反馈中学习。我们引入了 DAGO(有向非循环图优化),这是一个上下文多臂老虎机引导框架,可以学习在有限的评估预算下融合哪些父工作流程。 DAGO 将每个候选父组合制定为一个手臂,由其组成工作流程的代码和提示的预训练嵌入表示。对角线 LinUCB 策略学习跨臂的共享奖励模型,并平衡具有高预测后代质量的臂的开发与不确定性驱动的探索。选择手臂后,LLM通过摘要引导融合生成子工作流程,子工作流程的验证分数作为更新老虎机的奖励。共享的有向非循环图维护已发现的工作流程及其多父辈血统,为后续的手臂提案提供了不断扩大的父辈池。在涵盖数学推理、代码生成和问答的六个基准中,DAGO 在评估的基准中获得了最高的宏观平均得分。在匹配的验证评估预算下,它比 AFlow 从 80.3 提高到 81.7,同时将总搜索支出减少了 11.2%。 消融研究表明,LinUCB 引导的臂选择优于随机选择及其无探索变体,支持反馈驱动选择和探索-利用平衡的价值。

融合是新的突变:多臂老虎机引导的工作流图进化的原论文方法或结果图
图 1:DAGO 框架概述。 (a) DAG 存储工作流程、验证分数和父系谱系。 (b) 退火分数抽样建议母体组合。 (c) 对角线 LinUCB 从代码和提示嵌入中选择一个组合。 (d) 摘要引导融合生成一个子代。验证反馈更新LinUCB和DAG;返回得分最高的工作流程。