论文

当Agentic执行失败时:从遥测数据中检测与定位运行时故障

When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry

智能体系统智能体互操作协议Agent任务评测MCPA2A

摘要

基于LLM的智能体系统的可靠性是整个执行的属性(包括其工具调用、模型调用、护栏与智能体间消息),而不仅是最终答案的属性;然而只评估任务结果几乎揭示不了运行如何或为何失败。我们提出AGENTCHAOSBENCH,一个从执行遥测中检测与定位智能体系统运行时故障的基准。我们运行五个异构应用,它们通过Agent-to-Agent协议协调智能体、通过模型上下文协议调用工具,并在其工具、模型、护栏与智能体间边界注入十类运行故障(工具不可用或缓慢、响应损坏或超大、延迟/循环/误路由的委托以及被绕过的护栏),并附带无故障对照。所得数据集包含275条脱敏轨迹:250条故障执行覆盖十种故障类型,25条无故障对照。每条故障轨迹都与同一输入的无故障执行对齐;故障类型标签以及(在适用处)位置标签在诊断时被留出。在结构化单轨迹输入上,第一批零样本LLM基线表明该任务远未解决:参数量至多14B的本地检测器top-1故障类型准确率仅13.6-19.2%,前沿的DeepSeek-v4-pro也仅24.8%,同时识别故障类型及其位置最高止步于22%;依赖参照的故障(尤其是被绕过的护栏)从单条轨迹几乎无法解决。对齐参照改善了选定的相对性故障,但未能解决护栏绕过。留出的标签与紧凑的预测格式支持对基于LLM与非LLM诊断方法进行可复现比较。