论文

Agent-工具交互中的静默失败:对ToolUniverse的审计

Silent Failures in Agent-Tool Interaction: An Audit of ToolUniverse

模型评测评测方法与指标

摘要

Agentic AI系统正日益采用集成多个工具的自动化流水线。尽管既往研究与基准已经考察了这些Agentic系统的任务成功与任务完成,但关于Agent与工具交互的研究,特别是在生物学Agentic工作流中的研究仍然有限。本研究考察Agent与工具交互中的一类特定失败:工具调用看似成功,但工具经由API/封装器提供的部分或全部信息或功能不完整或缺失,且没有任何通信或通知告知用户或Agent存在这类缺失。我们称之为静默失败(silent failure),因为用户或Agent并未察觉此类失败已经发生。出于研究目的,我们开发了一种审计机制来识别Agent与工具交互中的此类静默失败,检查了ToolUniverse环境内集成的15个科学工具(及其相关API文档与工具文档)(ToolUniverse作为我们的实验环境,而非研究本身的对象)。我们围绕7个失败位点组织研究,刻画失败在链条中发生的位置。我们观测到91次失败(经LLM候选发现与自动化测试后人工验证),其中最常见的是数据或字段缺失以及搜索、过滤或排序标准的不一致。这91次失败大多发生在API层(51次)或封装层(25次),并存在向下游放大静默失败的潜在可能。结果表明,静默失败在事件的上游起源,并向下游传播,最终表现为看似有效的科学输出。我们提出情境可靠性(contextual reliability)的概念来应对此类失败,并建议在Agent-工具交互流水线全程进行测试、披露、监控与度量此类失败的机制。

Agent-工具交互中的静默失败:对ToolUniverse的审计:论文配图
图 2:实验方法流程图。