作者|沙丘智库研究团队

来源|沙丘社区(www.shaqiu.cn)

企业当前推进大模型落地,普遍面临“试点容易、上线困难、规模化更难”的问题。根本原因不只是模型能力不足,还包括生产治理体系不完善。企业可以通过传统监控发现服务器、接口和数据库异常,却难以发现大模型回答质量下降、RAG检索命中错误、提示词版本引入风险、Agent工具调用越权、模型输出不符合内容安全要求等问题。

AI 可观测性的价值,是在传统 IT 可观测能力之外,补齐面向大模型应用的质量、风险、成本和治理信号,使企业能够从“系统可用”进一步走向“结果可信、行为可控”。

在《AI可观测性市场指南》中,沙丘智库将AI可观测性定义为“企业围绕 AI 应用、模型、数据、检索、工具调用和业务结果,持续采集、分析和利用运行信号、质量信号、风险信号、成本信号和治理证据,以实现 AI 系统监控、评估、诊断、优化和合规证明的一套技术与管理体系。”

AI Agent带来的可观测性挑战高于单次模型调用。Agent 会规划任务、拆解步骤、调用工具、访问外部系统、读取上下文,并在多轮过程中形成最终结果。错误可能在任一步骤出现,并沿着链路被放大。

因此,Agent 可观测性必须具备 trace 级链路追踪能力,覆盖输入、计划、中间步骤、工具调用、外部 API 交互、检索上下文、权限校验、安全拦截、人工确认和最终输出。

沙丘智库通过深度研究火山引擎、京东科技、蚂蚁集团等互联网大厂的Agent可观测实践,旨在为其他企业提供参考。

案例1:火山引擎大规模Agent可观测与质量保障实践

火山引擎围绕大规模 Agent 落地中的黑盒、链路断层和成本失控问题,建设统一可观测底座,并进一步面向 AI 与 Agent 场景补充语义指标、调用链诊断、记忆与知识库观测、数据回流和评测闭环。

OpenClaw 是火山引擎验证 Agent 可观测和质量保障体系的重要场景。OpenClaw 运行过程中涉及配置文件、插件、版本迭代和多类运行状态,任何操作都可能导致配置异常、启动失败或反馈异常。在接入统一观测之前,排障通常需要 OpenClaw 开发团队、运维团队、模型团队和基础设施团队共同参与,问题定位成本较高。

接入统一观测底座后,OpenClaw 的 MTTR 降低 80% 以上。核心做法是以 SLI 度量先行,建设数据驱动的全链路可观测体系。传统系统的SLI通常重点关注成功率和延迟;OpenClaw 中,一个请求从进入到返回,需要经过多步推理、多次工具调用和内部状态更新,因此需要“多层+可归因+面向任务”的SLI 体系。

完整内容:火山引擎大规模Agent可观测与质量保障实践

案例2:京东科技Agent观测与管控实践

京东科技构建面向执行过程的Agent观测与管控体系,将结果验证与过程观测结合,通过AI监督Agent运行,并进一步形成事前规约、事中干预、事后复盘的全流程管控机制,结合告警、审批、阻断、审计、回滚、指令纠正和人工升级等策略,推动Agent监督模式从人工全量盯防转向异常驱动式精准审核。

完整内容:京东科技Agent观测与管控实践

案例3:蚂蚁集团大模型推理可观测工程实践

传统微服务Trace难以穿透推理引擎内部,性能延迟与输出精度异常的根因均隐含在 Token 生成过程中,必须下钻至 Token 粒度才能完成根因解释。

蚂蚁集团搭建推理云全链路可观测体系,统一异构硬件、引擎与部署架构下的观测标准,创新推出以Token为粒度的推理可观测方案,实现请求并发可视化与候选 Token 概率分析,将推理性能与精度问题定位从小时级缩短至分钟级。

完整内容:蚂蚁集团大模型推理可观测工程实践

相关研究
企业级OpenClaw应用价值与风险分析报告
MCP Server与Tool设计研究报告
2026年中国银行业大模型应用场景评估报告
2026年中国保险业大模型应用场景评估报告
2026年中国消费品零售业大模型应用跟踪报告

大模型应用跟踪调研(2026年3-4月)

...

*更多生成式AI研究可前往“沙丘智库”小程序查阅

*有任何需求可咨询客服微信:zimu738