论文

LLM Agent故障的实时检测与修复

Real-Time Detection and Repair of LLM Agent Failures

AI 基础设施可观测性

摘要

LLM Agent会在执行中循环、级联工具错误、偏离目标、编造结果或静默接受损坏内容,而逐步调用第二个LLM评审的成本可能超过Agent本身。我们研究仅利用可观测步骤遥测、每步微秒级且只以健康运行训练的监控器,能检测多少故障。2823个已提交运行涵盖三种框架、三个本地模型和Gemini-2.5-Flash API;一类回声状态网络集成配合CUSUM报警,在5%误报预算下检测71%的故障,AUROC为0.872。相比无记忆基线,其优势随故障发生后的长度单调增加:不超过三步为+0.09,至少九步为+0.40,并在AFTraj-2K上样本外预测自身失效区域。无需重训即可迁移排序到其他团队语料,AFTraj-2K为0.745、ATBench为0.779,但健康零分布需按部署校准:冷迁移AUROC为0.527,重校准为0.885,且仍有误报。我们增加确定性验证层,按实际工具结果重算声明总值并检查必需调用是否执行。直接比较中,它检测60%的故障,加入覆盖检查后为96%,63个正常案例中零误报;监控器为54%检出、17%误报。该验证不变迁移到Llama3.1-8B,110个故障全检出、十个正常案例零误报,在1825个健康运行中也未触发。报警后回滚并实时重跑,恢复45%的故障,重采样控制为16%(p=0.0005),任务成功率由52%升至73%,每次运行约增加一个模型调用。系统约每步200微秒,比评审调用低三个数量级,并公开代码、轨迹和结果。

LLM Agent故障的实时检测与修复:论文配图
图 1:真实代理跟踪(ollama7b:qwen2.5:7b 与真实工具对比)。每个故障类别的一类 CUSUM 分数流;虚线 = 5% 验证 FA 预算的阈值,点线 = 验证的注入开始。健康的运行保持在线以下两个数量级,并且每个注入的类——上下文损坏、目标漂移、循环和工具级联——在发生后一步发出警报。第六个面板是锚定损失,它在类型上有所不同:制作不能注入到实时运行中,因此这一集是来自有机(非注入)语料库的真实片段,根据该语料库自身的健康零值进行评分。累积和保持平坦——捏造的数字不会扰乱任何行为通道——并且类被确定性基础验证器捕获。这是验证者要覆盖的盲点,是显示出来的,而不是断言的。请注意,yy 轴是符号对数:实际流跨越 12 个数量级,因为一旦出现故障,CUSUM 就会以乘法方式累积。