论文
工具调用成功,工作流为何仍失败:智能体与工具边界的异常
When Tool Calls Succeed but Workflows Fail: Anomalies at the Agent-Tool Boundary
摘要
AI智能体越来越多地执行长时间工作流,通过由不同提供方供应的工具在外部产生效果。在重试、推测执行、并发和部分失败下,外部最终状态可能不符合工作流预期的处理结果:必要效果可能缺失或重复,已中止操作的效果可能残留,已提交效果也可能依赖之后被撤回的临时状态。高级事务模型可以处理相关故障,但前提是底层操作暴露其所需语义,包括效果是否发生、是否可以补偿、暂存或安全重排。共享的智能体—工具接口通常不具备这些能力。我们提出效果历史模型,将外部世界的事件与运行时对它们的观测区分开来,并整理八类反复出现的外部效果异常。由此推导出一般情况下排除每类异常所需的边界能力,以及仅靠黑盒工具调用无法提供普遍保证的四处限制。随后,我们考察这些能力在一种广泛使用的共享工具接口中能够表达多少,统计已注册MCP服务器暴露的98,291个工具对标准注解词汇的使用。相关字段虽被广泛输出,却只能提供粗粒度的调用级提示,且没有一项所需能力能被完整表达。这些结果说明有必要在工具边界建立可复用的事务契约。