论文

使用基于大语言模型的系统支持工业测试失败分析:经验报告

Supporting Industrial Test-Failure Analysis with LLM-Based Systems: An Experience Report

智能体系统Agent任务评测

摘要

本研究检查了工具增强型大型语言模型 (LLM) 系统,用于支持 Westermo Network Technologies AB 夜间测试失败的根本原因分析 (RCA)。每晚的测试执行会产生异构的测试数据和日志,目前从业者需要跨多个来源手动检查这些数据和日志。我们在单代理和协调的多代理配置中实施了 RCA 工作流程,两者都可以访问测试元数据和日志。一项探索性工业案例研究使用了两个真实的故障场景。六名从业者通过调查和焦点小组评估了情景报告,并从 120 次重复执行中收集了操作测量结果。评估涵盖从业者感知的正确性、推理质量、固定现实性、清晰度、有用性和信任度,以及成本、持续时间和一致性。在这两种情况下,两种配置都没有表现出从业者认为一致的质量优势。单一代理系统以更快的速度和更低的成本生成报告,使其成为这种情况下更实用的基准。代理架构的潜在优势需要在更复杂的场景中进行进一步评估。