论文

使用结构覆盖标准测试代理工作流程

Testing Agentic Workflows with Structural Coverage Criteria

智能体系统Agent任务评测

摘要

多代理系统越来越多地暴露明确的工作流结构:代理、工具、工具访问规则、限制和委托路径。现有的评估在很大程度上依赖于端到端任务的成功、基准分数、最终响应质量或即时级别检查,这些提供的证据有限,表明这种宣布的协调结构实际上已经得到了运用。这使得评估测试套件的充分性或检测工具访问、限制和代理间委托方面的结构回归变得困难。我们通过多代理工作流程规范的结构测试方法来解决这一差距。该方法将每个工作流表示为类型化协调图,派生出可到达代理的覆盖义务、允许的工具边缘、受限的工具边缘和委托边缘,并使用覆盖驱动的生成和基于 DSPy 的场景实现来生成可执行测试。该图确定了必须涵盖的内容; DSPy 将这些义务实现为自然语言场景,其见证人在运行时进行检查。我们针对 OpenAI Agents SDK 式工作流程实施该方法,并在 10 个 SDK 派生基准上对其进行评估,其中包括 49 个可到达的代理、47 个工具和 403 个结构义务。生成的场景见证了有限细化预算内的 54/75 允许工具义务和 36/48 授权义务。对抗性限制工具标准引发 23/248 限制调用违规,将其限制处于探测状态的工作流程与具有具体错误路由故障的工作流程分开。这些结果表明,结构覆盖为多代理工作流测试提供了有用的充分性层:它不会取代语义或端到端评估,而是揭示是否已执行声明的代理、工具访问规则、限制和委托路径。