论文

TraceBench:LLM 代理的时间序列根本原因归因的受控评估

TraceBench: Controlled Evaluation of LLM Agents for Time-Series Root-Cause Attribution

智能体系统Agent任务评测

摘要

LLM 代理越来越多地应用于从现实世界系统收集的时间序列观察中的异常检测和根本原因分析;然而,他们在这些任务上的表现尚未在受控条件下进行系统评估。我们引入了 TraceBench,这是一个基于模拟的框架,用于生成受控的根本原因归因任务。在每个生成的任务中,代理接收通过模拟物理动力系统产生的时间序列观察结果,并且必须确定系统参数在模拟过程中是否发生改变,如果发生改变,则确定是哪一个。使用 TraceBench,我们从三个可解释的机械系统生成任务,并在受控实验条件下系统地评估四个 LLM 代理,从而对这些代理如何分析动态系统的时间序列观察结果产生新的见解。我们的结果表明,智能体从领域上下文中受益匪浅,并且主要通过数字控制台输出而不是可视化来探索数据。我们还发现,当需要生成将每个时间序列样本映射到预测的根本原因标签的 Python 脚本时,代理通常比直接提交预测时表现更差。我们在我们的网站tracebench.github.io 上发布了我们的数据集、智能体轨迹、实验结果和排行榜。