论文

当错误成为叙述时:生产 LLM 代理运行时中静默故障的纵向分类

When Errors Become Narratives: A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime

AI 基础设施可观测性

摘要

LLM 代理系统越来越多地作为长期自治运行时运行:调度作业、调用工具、维护内存以及将结果推送给人类。我们对这样一个系统中的无声故障进行了纵向研究:自 2026 年 3 月以来连续生产的个人助理代理运行时,大约有 40 个预定作业、8 个 LLM 提供程序、一个工具治理代理和一个知识库内存平面,由 4,286 个单元测试和 827 个治理检查来保护。在八周的时间里,我们记录了 22 起事件,并进行了完整的根本原因事后分析,其中一种元模式(错误信号从未以可操作形式到达人类的故障)至少出现了 28 次。我们得出了一个五类、以机制为导向的分类法:(A)环境和平台怪癖,(B)设计假设不匹配,(C)错误吞噬和稀释,(D)链式幻觉和捏造,(E)操作遗漏和取证盲点。 D 类是 LLM 系统所独有的,也是最危险的:系统不仅无法报告错误,LLM 还将错误转换为流畅、可信的叙述传递给用户。我们将这种失败称为似是而非:灰色失败的微分可观察性升级——观察者不仅是盲目的,而且令人信服地被失败本身欺骗了。三个发现:大约 70% 的无声故障是通过人类用户视图观察发现的,而不是测试或审计;对 15 起事件的回顾性审计发现,事前预防率为 0%,但回归阻止率为 87%——审计是回归引擎,而不是预测引擎;事件延迟(13 小时到 60 天)跟踪故障机制,而不是代码复杂性——最长的故障存在于组件之间的接缝处,那里没有测试运行。我们描述了由此产生的防御框架,并提炼了代理系统的设计原则,这些系统的故障是响亮的、可归因的和无聊的。所有事后分析和文物都是公开的。