论文
TELLER:LLM 推理的非侵入式跨层根本原因分析
TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference
摘要
大语言模型 (LLM) 推理已从离线工作负载演变为连续运行的软件服务,但根本原因分析仍然很困难,因为单个请求跨越推理引擎、Python/C++ 后端、主机 CUDA API、GPU 内核和分布式通信。现有的探查器公开原始时间线,而基于日志的诊断通常会错过跨层执行语义和请求级结构。我们推出 TELLER,一种非侵入式跟踪和日志感知 LLM 推理根本原因分析框架。 TELLER 首先收集 NVTX/CUPTI 跟踪和服务日志,而不修改模型二进制文件,然后重建每个请求的调用链树并将日志行与相应的执行步骤对齐。我们引入了一个依赖感知的因果上下文切片,它保留了父子结构、时间顺序和通信关系,以及一个跟踪对编码(TPE)标记器,它将这些切片压缩成具有父、深度和持续时间属性的紧凑结构标记序列。在这些表示之上,TELLER 将数字候选定位与多模态根本原因模型相结合,共同预测异常步骤、定位可疑操作员并生成自然语言解释。多节点 GPU 推理工作负载的实验显示出明显的压缩精度权衡:适度的 TPE 词汇可将每步跟踪长度减少 80% 以上,同时在水平(跨节点通信)和垂直(节点内执行堆栈)视图上实现最佳整体性能,而更激进的压缩会大大降低诊断质量。在低故障先验、强化基线、模态消融、解释质量检查和跟踪开销下的进一步分析表明,TELLER 为 LLM 推理 RCA 提供了实用的分类和证据定位基础。