论文

检测、解释、解释:时间序列异常检测、可解释性和可解释性的端到端基准

Detect, Explain, Interpret: An End-to-End Benchmark for Time Series Anomaly Detection, Explainability and Interpretability

模型评测基准与评测资源

摘要

由于复杂时间序列数据的可用性不断增加,时间序列异常检测受到越来越多的关注。这种激增导致了多种检测方法以及旨在彻底评估其性能的各种基准的开发。然而,大多数现有的检测器在很大程度上仍然与领域上下文无关,忽视了可解释性和可解释性。造成这种差距的主要原因之一是当前的基准主要关注检测精度,只有很少的基准评估空间可解释性。此外,目前还没有基准提供足够丰富的语义注释来支持生成人类可理解的异常解释。为了解决这些限制,我们引入了 SHAD(Scality 高维异常检测基准),这是一个完全注释的基准,由从 Scality 运营的现实世界分布式云存储系统收集的 215 个多元高维时间序列组成。所提出的数据集包含丰富的上下文信息,涵盖三个不同严重程度的异常家族。作为进一步的贡献,我们通过评估检测、可解释性和可解释性的基线方法,涵盖 TSAD 管道的所有阶段,为未来的工作奠定基础。对于检测,我们对各种现有的异常检测器进行了基准测试,测试它们在所提出的真实世界数据集上的有效性。然后,我们通过评估测量生成的异常分数中每个维度的贡献是否可以提供准确的异常归因来考虑可解释性。最后,为了可解释性,我们研究了冻结的大语言模型基线在定位和解释异常方面的有效性。