论文

JudgeFlow:基于块评判的Agentic工作流优化

JudgeFlow: Agentic Workflow Optimization via Block Judge

智能体系统Agent Harness

摘要

优化基于 LLM 的代理工作流程对于扩展 AI 功能来说具有挑战性。当前的方法依赖于粗略的、端到端的评估信号,缺乏关于在哪里进行优化的细粒度信号,通常会导致低效或低影响的修改。为了解决这些限制,我们提出了 {\our{}},一个评估-判断-优化-更新管道。我们将可重用、可配置的逻辑块合并到代理工作流程中,以捕获逻辑的基本形式。在此抽象之上,我们设计了一个专用的 Judge 模块,用于检查执行跟踪(尤其是失败的运行),并为有问题的块分配基于排名的责任分数。然后,基于 LLM 的优化器会利用这些细粒度的诊断信号,该优化器将修改重点放在工作流程中最有问题的块上。我们的方法提高了样本效率,通过块级诊断增强了可解释性,并为自动化日益复杂的代理工作流程提供了可扩展的基础。我们在数学推理和代码生成基准上评估 {\our{}},其中 {\our{}} 与现有方法相比实现了卓越的性能和效率。源代码可在 https://github.com/ma-zihan/JudgeFlow 上公开获取。