论文

JFTA-Bench:评估LLM使用故障树追踪与分析故障的能力

JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

在复杂系统的维护中,故障树被用于定位问题并提供针对性的解决方案。为了让以图像形式存储的故障树能够被大语言模型(LLM)直接处理,从而协助追踪与分析故障,我们提出了一种新的故障树文本表示方法。在此基础上,我们构建了一个面向多轮对话系统的基准,强调复杂环境中的鲁棒交互,用于评估模型协助故障定位的能力,该基准包含3130条条目,平均每条40.75轮对话。我们训练了一个端到端模型来生成模糊信息以模拟用户行为,并引入长程回滚与恢复流程来模拟用户出错场景,从而能够评估模型在任务追踪与错误恢复方面的综合能力,其中Gemini 2.5 pro取得了最佳性能。

JFTA-Bench:评估LLM使用故障树追踪与分析故障的能力:论文配图
图 1:左图展示了人机交互数据收集过程。中间面板描述了能够处理 DAG 结构的路径采样程序。右图展示了具有用户回滚场景的多轮评估框架。