论文

SilentProbe:测量用作代理工具的生产 API 中的静默故障

SilentProbe: Measuring Silent Failure in Production APIs Used as Agent Tools

智能体系统Agent任务评测

摘要

调用生产 API 的 LLM 代理无法区分不匹配任何内容的查询和服务器无法理解的查询。两者都返回带有可解析主体的 HTTP 200,没有要捕获的异常,也没有要分支的字段。我们询问什么可以预测发生哪一种情况,以及它对智能体有何影响。审核 2,501 个独立发布的 OpenAPI 文档中的 721,320 个参数,我们发现 7.5% 声明了枚举,15.2% 声明了任何机器可检查的约束,而 40.1% 的文档在散文中至少声明了一个其模式未编码的约束。针对来自 27 个供应商的实时商业端点执行 219 个模式衍生的扰动,通过发布模式并为每个调用返回运行标识符的单个聚合层 (Monid) 实现,我们发现约束形式(而不是供应商身份)预测诚实性:机器可检查的约束在 111 个案例中的 111 个案例中产生了诚实错误,纯散文约束在 61 个案例中的 44 个案例中默默失败(p = 2e-13)。随后,八个系列的 12 个模型在普通任务中达到了这些终点。在 88 次尝试中,每个模型有 88 次错过了描述中仅举例说明的词汇,而完整写出的词汇在 88% 到 91% 的时间内被正确使用。运行完整的代理循环,模型在 12% 的情况下检测到由此产生的静默故障,在 0% 的情况下进行修复,在 41% 的情况下向用户断言漏报,并在 12% 的情况下发明了一个数字。将词汇表提升到模式中可以消除故障,从 88 个中的 88 个变为 89 个中的 0 个。解决方案是一行模式而不是更好的模型。代码、模式、扰动集、代理转录本和每次调用运行标识符均在 https://github.com/Jasper0122/silentprobe 上发布。