论文
FailureAtlas:多提供商 LLM 服务基础设施中的故障模式分类
FailureAtlas: A Taxonomy of Failure Modes in Multi-Provider LLM Serving Infrastructure
摘要
多提供商 LLM 网关反向代理,可跨基础模型 API 路由、负载平衡和速率限制请求,已成为关键的生产基础设施。然而,特定于该架构层的故障模式仍然没有记录,分散在问题跟踪器和事后分析中,没有统一的框架。我们引入 \fa{},一个两轴分类法,通过 \emph{原始层}(网络/传输、流/协议、状态/会话、模型行为、治理/成本)及其 \emph{可检测性}(响亮与\静音)对故障进行分类。我们用来自公共错误报告和第一手压力测试的五个经过验证的目录条目填充此分类法,每个目录条目都附有机械根本原因分析。三个条目包括独立的复制脚本。我们的主要发现是,最严重的操作故障是 \emph{silent}:它们返回 HTTP~200,通过每个标准运行状况检查,并以需要语义级可观察性来检测的方式破坏应用程序状态。在 \cb{} 评估活动期间,我们直接发现了两个这样的无声故障:导致历史记录丢失的并发竞争条件和破坏工具调用有效负载的流索引冲突。