论文

Bian Que:面向在线系统运维的灵活技能编排智能体框架

Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations

智能体系统上下文与知识记忆Agent HarnessAgent记忆

摘要

运营和维护(O&M)大型在线引擎系统(搜索、推荐、广告)需要大量人力来进行发布监控、警报响应和根本原因分析。虽然基于 LLM 的代理非常适合这些任务,但部署瓶颈不是推理能力,而是编排:为每个操作事件选择相关数据(指标、日志、更改事件)和适用的操作知识(手册规则和从业者经验)。不加区别地提供所有信号会导致稀释和幻觉,而手动策划事件到(数据、知识)的映射在每天数十次发布的情况下是很棘手的。我们提出扁鹊,一个具有三个贡献的代理框架:(i)一个\emph{统一操作范式},将日常运维抽象为三种规范模式:发布拦截、主动检查和警报根本原因分析; (ii) \emph{灵活的技能安排},其中每个技能指定针对给定业务模块上下文检索哪些数据和知识,并且可以由大语言模型自动生成和更新,或者通过待命工程师的自然语言指令迭代细化; (iii)一种\emph{统一的自我进化机制},其中一个校正信号驱动两个并行路径,即案例记忆到知识的蒸馏和有针对性的技能精炼。扁鹊部署在国内主要短视频平台快手电商搜索引擎上,报警量减少75%,根因分析准确率达到80%,平均解决时间缩短50%以上。我们的框架离线评估的通过率达到99.0%。我们的代码可在 https://github.com/benchen4395/BianQue_Assistant 获取。

Bian Que:面向在线系统运维的灵活技能编排智能体框架
图 1:扁鹊架构概述。来自 OPS 平台(顶部)的操作事件被分派到匹配的代理,该代理调用一个或多个匹配的技能来组装相关数据(系统信号:日志、指标、变更事件)和知识(从案例内存中提取的领域知识,由操作手册播种),供大语言模型进行推理;诊断结果返回OPS平台。从业者的反馈沿着两条平行的路径回流(黄色:技能精炼;紫色:记忆到知识的蒸馏)。