技术实践

腾讯使用单 Agent 汇集多源证据排查错误码

智能体系统上下文与知识检索增强Agent 架构与控制循环Agent 工具调用Agent任务评测

概述

腾讯错误码治理团队将排障做成 Agent 工作流,连接知识库、代码关系图谱、可观测平台和代码托管平台,并用 Skill 固化排查步骤与规则。输出前检查结构与证据,结果按置信度交给 SRE 审核。 团队称,上线近一个月,日均处理数百条去重告警,单个排查由3—8小时缩至分钟级。对50个案例经过五轮提示调优后,与人工标注的一致率由66%升至88%,需人工介入率由34%降至12%。 这50个案例同时用于调优与回归,结果不等同于新错误码的泛化表现。投入生产后仍需持续检查错判、人工复核和复杂故障的证据覆盖。