论文
用于评估微服务故障诊断中的 LLM 代理的多数据集基准
A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis
摘要
基于 LLM 的代理正在将微服务操作重塑为 AgentOps,其中基准是评估多模态可观测性数据故障诊断的关键。然而,现有的基准仍然很大程度上以结果为导向:它们只对最终答案进行评分,而未能评估故障诊断中的系统推理过程。我们通过在推理过程评估范式下引入两个大型数据集(AIOps2025 和 RCA100)来解决这一差距,该范式从三个维度评估代理诊断能力:定位(故障发生的位置)、识别(故障的类型)和原因(推理轨迹是否基于相关证据)。这两个数据集总共包含两个代表性微服务系统(HipsterShop 和 OpenTelemetry Demo Store)中超过 500 个专家标记的故障案例。它们涵盖了跨资源、网络、运行时、中间件/数据库和应用程序逻辑类别的各种故障场景,并提供细粒度的因果证据来支持代理学习和推理过程评估。除了规模和覆盖范围之外,数据集还经过领域专家仔细标记,并通过大规模竞赛进行验证,支持 6,000 多个参赛团队。这使得它们不仅是专家标记的诊断数据集,而且是经过竞争验证的基准,用于评估现实微服务环境中的代理故障诊断。数据集可在 https://www.aiops.cn/gitlab/aiops-live-benchmark/agenticopseval 获取。