论文

故意不服从:自动检测代理跟踪中的故障

Willful Disobedience: Automatically Detecting Failures in Agentic Traces

智能体系统Agent任务评测

摘要

人工智能代理越来越多地嵌入到真实的软件系统中,它们通过多轮对话、工具调用和中间决策来执行多步骤工作流程。这些较长的执行历史(称为代理跟踪)使验证变得困难。仅结果基准可能会错过关键的程序故障,例如不正确的工作流程路由、不安全的工具使用或违反提示指定的规则。本文介绍了 AgentPex,这是一种人工智能驱动的工具,旨在系统地评估代理痕迹。 AgentPex 从代理提示和系统指令中提取行为规则,然后使用这些规范自动评估跟踪的合规性。我们根据 $τ^2$-bench 的 424 条跟踪对电信、零售和航空公司客户服务模型进行评估。我们的结果表明,AgentPex 可以区分模型中的代理行为和表面规范违规行为,而这些违规行为是仅结果评分无法捕获的。它还提供按领域和指标进行的细粒度分析,使开发人员能够大规模了解代理的优势和劣势。 AgentPex 的源代码可在 https://github.com/microsoft/agentpex 获取。