论文

ARFBench:软件事件响应的时间序列问答能力基准测试

ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response

模型评测基准与评测资源

摘要

时间序列问答(TSQA),即我们提出自然语言问题来推断和推理时间序列的属性,是基础模型的一项有前途但尚未充分开发的功能。在这项工作中,我们提出了 ARFBench,这是一个 TSQA 基准,用于评估多模态基础模型 (FM) 对软件事件数据中普遍存在的时间序列异常的理解。 ARFBench 包含 142 个时间序列的 750 个问题和来自 63 个生产事件的 538 万个数据点,这些数据完全来自 Datadog 的内部遥测。我们评估了领先的专有和开源 LLM、VLM 和时间序列 FM,并观察到前沿 VLM 的性能明显优于现有基线;领先模型 (GPT-5) 的准确率达到 62.7%,F1 达到 51.9%。接下来,我们将展示专门的多式联运方法的前景。我们开发了一种新颖的 TSFM + VLM 混合原型,我们对一小组合成数据和真实数据进行后训练,产生与前沿模型相当的整体 F1 和准确性。最后,我们发现模型和人类领域专家表现出互补的优势。我们定义了一个模型专家预言机,一个针对模型和专家答案的 2 最佳预言机选择器,产生 82.8% F1 和 87.2% 的准确率,并为未来 TSQA 模型建立了一个新的超人前沿。该基准可在 https://huggingface.co/datasets/Datadog/ARFBench 上获取。