论文

LLM真的能恢复微服务故障吗?诊断到行动推理的恢复感知评估

Can LLMs Really Recover Microservice Failures? A Recovery-Aware Evaluation of Diagnosis-to-Action Reasoning

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于解释操作证据并协助云原生微服务系统中的事件响应。然而,面向恢复的用例需要的不仅仅是确定根本原因。在观察症状并诊断故障后,操作员或代理必须将诊断结果转化为具体的恢复操作,将其应用于可接受的目标,并验证服务运行状况是否已恢复。现有的 RCA 和日志分析评估非常适合诊断,但它们并不能描述后续行动决策的特征。本文提出了 R2Act,一种用于诊断后事件响应的恢复行动评估框架。 R2Act 定义了事件模式、质量门、操作空间表示、恢复有效性指标、离线评估器和实时重放协议。我们将该框架实例化为来自 \system 的 302 个经过质量审核的 Kubernetes 事件的基准数据集。每个事件都提供同步的多模式观察、根本原因标签、特定于事件的操作空间以及带注释的有效和无效恢复计划。我们评估启发式、监督式、面向 RCA、深度日志和基于 LLM 的方法。基于RAG的最强LLM达到了91.4\%--99.7\%的根本原因服务准确率,但其恢复有效性仍然只有36.8\%--60.3\%。即使根本原因服务和故障类型都正确,面向恢复的方法仍然对 39.5\%--62.0\% 正确诊断的事件选择无效的操作。总体而言,这项工作表明,许多恢复失败并不是因为缺乏诊断知识,而是因为难以将诊断证据转化为有效的恢复行动和可接受的目标。这项工作为研究和评估提供了一个可重复的、简化的起点。