技术实践

京东零售以女娲智能体串联告警到发布

AI 基础设施智能体系统应用与实践Agent 动作执行与治理Agent HarnessAI 开发与运维平台可观测性编程

概述

京东零售为补齐研发运维链路“从发现问题到解决问题”的最后一公里,交付「女娲」AI 数字员工:接到 P0/P1 告警后经 DongMonitor/自定义告警自动提取应用名、TraceID、时间戳等元数据,依托内部 .Logbook 日志检索与日志路径查询 Skill 按关键字与时间窗分页轮询构建调用链视图;随后由大模型对日志上下文、近期变更与配置差异做联合语义分析定位根因,并按是否在代码中做分流——非代码问题直接出分析报告,代码 Bug 与代码托管平台(Coding)交互,基于 AST 静态分析推导影响面、生成含兼容性与回滚难度评估的修复方案,主干建分支、AI 自动修复后自动填充 MR 模板,内置 Code Review Skill 先过一轮风格/缺陷/性能/安全扫描,人工审批后自动 Merge 并触发行云编排发布;同时支持京 ME/IM 卡片在移动端确认与追溯。平台处于灰度验证与能力泛化阶段,已在部分核心业务稳定运行,路线图为 L1 辅助驾驶 → L2 协同驾驶 → L3 自动驾驶。 团队针对过去三个月的故障复盘数据做对比分析:传统模式下 P1 级故障全流程约 2-4 小时,女娲辅助处理约 15-25 分钟,综合提效约 85%。分环节看,告警感知与日志检索由 20-40 分钟降至 5 分钟以内(人效释放 80%),根因定位与分析由 30-60 分钟降至 2-5 分钟(人效释放 90%),代码修复与验证由 40-90 分钟降至 5-10 分钟(人效释放 85%),发布与部署由 15-30 分钟降至 3-5 分钟(人效释放 80%);核心指标口径为人力投入降低 60%、MTTR 由 120-240 分钟降至 15-25 分钟(文内标注降低 50%)、故障风险降低 70%、运维成本降低 40%。团队内部复盘调研显示,传统模式下一次 P1/P2 故障工程师平均需在 4-6 个系统间跳转,仅“定位+理解问题”就占超过 60% 的处理时间,其中约 60% 属已知模式的新实例(空指针、越界、资源泄露、配置错误等)。