论文
APIFlow-Bench:衡量智能体能否完成长程、相互依赖的API工作流
APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows
摘要
使用工具的代理通常通过单个位进行评估:端到端工作流程是否完成。该指标无法区分生产中重要的故障,例如过期的凭据、格式错误的有效负载或正确执行后的最终交付不正确。我们引入了 APIFlow-Bench,这是一个针对长期、依赖的 REST-API 工作流程的完全可审核的基准,它将性能分解为七种工程功能,并要求代理生成由实际调用路径支持的答案。我们逐个子任务地生成合成 API 世界;只有在零LLM自测三合会验证其评分者和预言机确定可解决性,并且对抗性审计识别并修复了六个评分者漏洞之后,每个子任务才会被承认。评分是确定性的且对出处敏感:状态检查通过 API 数据流跟踪模拟铸造的金丝雀,直到答案必须源自响应,并且逐个字段验证键入的答题卡。我们公布了所有答案和 44,362 份未经编辑的执行记录。在一个中性支架下的 19 个前沿和开放权重模型中,我们发现:(1) 较长的依赖链会降低成功率,从单个子任务的 93% 下降到干净的 20 个子任务链上的 74%,当包括模型共识屏幕标记为没有模型通过的 8% 的链试验时,成功率达到 61%; (2) 可靠性比最佳情况能力更能区分模型,五局三胜制的可靠性跨越 7 分,但五局五胜制的可靠性跨越 44 分; (3) 复合失败的独立错误帐户与数据不相符:20 个子任务链上的通过率比子任务级别率的乘积高出 33 个百分点,并且在干净切片上,77% 的失败运行达到了正确的最终状态,并且仅在交付时失败。
