技术实践
阿里与蚂蚁用LoongSuite观测Agent及推理链路
概述
可观测团队把自建的 GenAI 语义规范接入集团内部真实业务:Agent 侧已在 OpenClaw、QwenPaw、Hermes Agent 等多个场景完成埋点落地,形成从 Agent 层到基建层的全栈可观测能力,可按功能域聚合分析 Skill 错误率、延迟劣化与 LLM 耗时占比。推理侧在 vLLM、SGLang、TensorRT-LLM 三大引擎上按规范采集 Token 级数据,形成引擎显微镜产品,提供引擎并发剖析与 Token 分析(含 Top-K 候选分布)。 产品上线后经历年底大促,帮助引擎/SRE/业务定位多起稳定性问题,作者自述问题定界效率提升 10 倍。文中给出两个典型案例:某请求第 125 个 Token 耗时 6.8 秒系其他租户 prefill 中断 decode 所致,建议 PD 分离。另一案例以首 Token 出现 begin_of_sentence 定位到模型 badcase 导致的答非所问。