论文
重新思考Agentic RCA 的工具设计:一项受控实证研究
Rethinking Tool Design for Agentic RCA: A Controlled Empirical Study
摘要
大语言模型 (LLM) 智能体越来越多地用于微服务系统中的根本原因分析 (RCA),但有关如何设计和组合其工具的经验指导仍然有限。我们对跨模型和微服务环境的工具抽象和组合进行了受控实证研究。我们实现了 24 个结构化工具,用于指标访问 (L1)、证据分析 (L2) 和诊断 (L3),以及基于 Python 的参考设置 (L0)。使用来自三个微服务系统的 375 个故障案例,我们使用 Qwen3.7-Plus 评估了八种配置,并在四种配置的共享子集上比较了四种 Qwen 模型。我们的结果表明,工具配置对根本原因定位和故障类型识别的影响不同。借助 Qwen3.7-Plus,L3 实现了 82.8% 的 top-1 定位精度,而 L0 的定位精度为 85.4%,而每个案例所需的时间不到一半。添加工具级别可以改进类型识别,同时降低定位精度。轨迹分析揭示了在咨询额外证据后智能体推翻正确诊断建议的情况。模型选择也会改变工具的优势:在 L1+L2 中添加 L3 可以改善三个模型的诊断,但会损害很少调用 L3 的 Qwen3-8B。微服务系统中的工具配置排名进一步变化。这些发现为设计和使用 RCA 工具提供了经验基础,指导根据模型、诊断目标和目标系统选择和组合工具。
