论文

APIFlow-Bench:衡量智能体能否完成长程、相互依赖的API工作流

APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows

智能体系统Agent任务评测长程任务评测

摘要

使用工具的代理通常通过单个位进行评估:端到端工作流程是否完成。该指标无法区分生产中重要的故障,例如过期的凭据、格式错误的有效负载或正确执行后的最终交付不正确。我们引入了 APIFlow-Bench,这是一个针对长期、依赖的 REST-API 工作流程的完全可审核的基准,它将性能分解为七种工程功能,并要求代理生成由实际调用路径支持的答案。我们逐个子任务地生成合成 API 世界;只有在零LLM自测三合会验证其评分者和预言机确定可解决性,并且对抗性审计识别并修复了六个评分者漏洞之后,每个子任务才会被承认。评分是确定性的且对出处敏感:状态检查通过 API 数据流跟踪模拟铸造的金丝雀,直到答案必须源自响应,并且逐个字段验证键入的答题卡。我们公布了所有答案和 44,362 份未经编辑的执行记录。在一个中性支架下的 19 个前沿和开放权重模型中,我们发现:(1) 较长的依赖链会降低成功率,从单个子任务的 93% 下降到干净的 20 个子任务链上的 74%,当包括模型共识屏幕标记为没有模型通过的 8% 的链试验时,成功率达到 61%; (2) 可靠性比最佳情况能力更能区分模型,五局三胜制的可靠性跨越 7 分,但五局五胜制的可靠性跨越 44 分; (3) 复合失败的独立错误帐户与数据不相符:20 个子任务链上的通过率比子任务级别率的乘积高出 33 个百分点,并且在干净切片上,77% 的失败运行达到了正确的最终状态,并且仅在交付时失败。

APIFlow-Bench:衡量智能体能否完成长程、相互依赖的API工作流:论文配图
图8:20个子任务切片,每个细胞(世界、模型)横跨五个世纪,各行最难排序,并贴上世界主导轴的标签。世界差异(行)超过各模型的差异(列)。零位为两行的单元格是无型号的单元格,但有一个参考解决方案可以清除组装的分级器(§7);无论它们是硬的还是压缩的文物,都保留了开着。这意味着在解释前必须诊断出零行。