技术实践

百度以NetStudio智能体串联网络故障排查

应用与实践上下文与知识智能体系统检索增强Agent 架构与控制循环Agent 规划Agent 工具调用Agent 协作Agent Harness智能体互操作协议行业应用结构化分析、预测与决策MCP

概述

百度智能云网络运维团队面向数以万计设备、千万级端口规模的网络,构建三层智能化运维体系。AI 基建层:先对设备软硬件、SysLog、拓扑、IP 等 CMDB 数据做深度治理提升数据有效性;把过去两年沉淀的监控、定位、止损、巡检、变更等平台级自动化工具注册到 MCP Server,使其可被大模型或 Agent 直接调用;并基于 BPMN 自研百度网络流程引擎 BNE 承载 SOP 线上化编排,再借助 Multi-Agent 框架把 LLM 能力嵌入 BNE,使网络工程师可构建智能体工作流(Agentic Workflows)。AI Agent 核心层:意图识别由 Host Agent + 网络 RAG 完成,结合运维知识库(设备信息、拓扑数据、故障案例、配置基线,存储于向量数据库)增强领域理解、避免幻觉;任务规划采用 Plan-Act 框架,Planner Agent 把复杂需求拆成步骤序列(如排查某机房故障拆为查看质量探测数据→查询异常 SysLog→查询机房变更→给出处理建议),Actor Agent 调度子 Agent 与工具执行并在失败时动态重规划,该环节使用推理大模型(如基于网络运营数据集训练后的 DeepSeek-R1);工具执行采用 ReAct 框架,子 Agent 按任务类型经 MCP 工具库调用 CMDB 数据与网管工具 API,按「思考-行动-观察」循环迭代;特定场景另配微调后的垂类小模型以理解网络知识与设备命令。AI 业务场景层由网工自建子 Agent,覆盖故障排查与闭环、数据可视与分析、问题咨询与服务、交付敏捷与提效。落地上启动核心项目 NetStudio,定位为面向网络从业者的 AI 原生统一工作台,以 LUI(语言用户界面)为核心交互,提供设备数据可视化查询、跨域数据联动分析(打通光传输网 OTN 与业务网)、智能解析与信息统计三类能力;其架构由 Host Agent 调用 Planner Agent 生成计划、Act Agent 调度各专业 Scenario Agent、Conclusion Agent 汇总呈现,Agent 可主动对接工具与平台采集数据并在授权范围内自动执行巡检触发与异常处置;复杂场景引入 Agentic Workflows 实现端到端自动化。两个落地示例:机房故障排查子 Agent 可通过如流公众号一句话完成各模块数据收集、故障推断与行动建议;光纤故障推进由 AI 机器人「小光」在 Agentic Workflow 特定节点被唤起,以自然语言自主判断并调用工具,直接与链路供应商智能化沟通、全程跟进进度与升级,推动故障自动化闭环。成效数据:2025 年 11 月 AI 模型调用总量达 17.49 万次,较 10 月 2.98 万次环比激增 486.9%;按当前 token 市场价,AI 完成单任务成本 0.65 元/次,传统人工+工具 16 元/次,ROI 超 23 倍;单任务耗时 AI 30 秒/次、传统 8 分钟/次,处理时效提升 16 倍;AI 服务响应准确率 95%。正文未给出 NetStudio 的上线时间、覆盖用户规模与准确率统计口径。 针对传统定制化数据大屏需历经「需求提报-方案评审-研发实现-功能测试」冗长流程、跨部门人力消耗大、交付周期长的问题,团队构建了三步式 AI 可视化链路:第一步依托 MCP 完成所有后端数据接入,并通过 RAG + 网络数据湖实现各数据模块的关联查询与格式化处理;第二步基于百度开源的前端低代码框架 Amis(把「写 React 组件代码」变成「写 JSON 配置」,由框架自动把 JSON 转成对应 React 组件并渲染)结合大模型能力完成定制化数据展示组件;第三步按自然语言意图由多 Agent 协作最终绘制数据大屏,实现分钟级的创建与销毁,可用于一次性工作、统计汇报与数据分析。落地效果方面,今年双 11 团队首次推出 AI 全流程生成的云客户专属网络重保大屏,文中称产品一经亮相便超预期交付,彻底改变传统网络可视化「功能单一、呈现乏味」的固有印象,实现「随用随生成」的灵活体验,并配图展示某客户双 11 网络重保期间的专属大屏。背景场景包括光模块故障预判(IDC 内光模块部署量已达千万级规模,硬件故障频次攀升,威胁 AI 大模型训练等高敏感业务稳定性)、流量带宽成本管控与基于拓扑可视化的运维提效。正文未给出大屏的交付数量、生成耗时实测值与客户名称。