论文
LLM Agent故障的实时检测与修复
Real-Time Detection and Repair of LLM Agent Failures
摘要
LLM Agent会在执行中循环、级联工具错误、偏离目标、编造结果或静默接受损坏内容,而逐步调用第二个LLM评审的成本可能超过Agent本身。我们研究仅利用可观测步骤遥测、每步微秒级且只以健康运行训练的监控器,能检测多少故障。2823个已提交运行涵盖三种框架、三个本地模型和Gemini-2.5-Flash API;一类回声状态网络集成配合CUSUM报警,在5%误报预算下检测71%的故障,AUROC为0.872。相比无记忆基线,其优势随故障发生后的长度单调增加:不超过三步为+0.09,至少九步为+0.40,并在AFTraj-2K上样本外预测自身失效区域。无需重训即可迁移排序到其他团队语料,AFTraj-2K为0.745、ATBench为0.779,但健康零分布需按部署校准:冷迁移AUROC为0.527,重校准为0.885,且仍有误报。我们增加确定性验证层,按实际工具结果重算声明总值并检查必需调用是否执行。直接比较中,它检测60%的故障,加入覆盖检查后为96%,63个正常案例中零误报;监控器为54%检出、17%误报。该验证不变迁移到Llama3.1-8B,110个故障全检出、十个正常案例零误报,在1825个健康运行中也未触发。报警后回滚并实时重跑,恢复45%的故障,重采样控制为16%(p=0.0005),任务成功率由52%升至73%,每次运行约增加一个模型调用。系统约每步200微秒,比评审调用低三个数量级,并公开代码、轨迹和结果。
