论文
PROTEA:多代理 LLM 工作流程的离线评估和迭代细化
PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows
摘要
多代理 LLM 工作流程(由多个特定于角色的 LLM 调用组成的系统)通常优于单提示基线,但它们仍然难以调试和完善。故障可能源于传播到下游节点的中间输出中的细微错误,需要开发人员检查长跟踪并推断要修改哪个代理。我们推出了 PROTEA,这是一个统一的界面,用于离线、测试驱动的多代理工作流程改进。 PROTEA 执行工作流程,使用可配置的评分标准对中间节点输出进行评分,并在工作流程图上覆盖每个节点的状态和基本原理,以定位可能的瓶颈。为了支持以最终答案参考为主要监督的复杂系统,PROTEA 执行向后节点评估:它根据最终答案参考和图形上下文生成候选节点级期望,然后将它们与观察到的节点输出进行比较。对于选定的节点,PROTEA 会在比较之前/之后将有针对性的提示修订呈现为可编辑,然后自动重新运行和重新评估工作流程,以在同一界面中显示输出更改和评分轨迹。在两个与生产相邻的工作流程中,PROTEA 将文档检查准确度从 64.3% 提高到 83.9%,并将建议 Hit@5 从 0.30 提高到 0.38。在与六名经验丰富的 LLM 开发人员进行的形成性研究中,参与者重视图形级本地化、每个节点的基本原理以及及时修订之前/之后的可编辑性。