论文

WorkflowPerturb:用于评估多智能体工作流指标的校准压力测试

WorkflowPerturb: Calibrated Stress Tests for Evaluating Multi-Agent Workflow Metrics

模型评测智能体系统Agent Harness基准与评测资源

摘要

基于大语言模型的系统越来越多地为复杂任务生成结构化工作流程。在实践中,自动评估这些工作流程很困难,因为指标分数通常没有校准,并且分数变化不能直接传达工作流程退化的严重程度。我们引入了 WorkflowPerturb,一个用于研究工作流评估指标的受控基准。它的工作原理是将现实的、受控的扰动应用于黄金工作流程。 WorkflowPerturb 包含 4,973 个黄金工作流程和 44,757 个扰动变体,涉及三种扰动类型(缺失步骤、压缩步骤和描述更改),每种扰动类型的严重性级别分别为 10%、30% 和 50%。我们对多个指标系列进行基准测试,并使用预期分数轨迹和残差分析它们的敏感性和校准。我们的结果描述了指标系列之间的系统差异,并支持对工作流程评估分数的严重性感知解释。我们的数据集将在接受后发布。

WorkflowPerturb:用于评估多智能体工作流指标的校准压力测试
图1:展示客户支持升级任务中LLM生成工作流扰动的真实示例。缺失步骤:原始工作流中存在的红色节点在LLM生成版本中被省略。压缩步骤:原始工作流中的红色与蓝色节点被合并为单个蓝色节点,降低了工作流粒度。描述变化:所有节点保持与原始相同的语义,但句法措辞不同。