TimeRLM:递归语言模型实现长上下文时间序列中的精确异常定位
TimeRLM: Recursive Language Models Enable Precise Anomaly Localization in Long-Context Time-Series
摘要
长上下文时间序列上的精确异常定位是临床护理、工业运营、金融服务和物流等领域监控应用的一项关键任务,在这些应用中,简短的证据可能隐藏在长跨度的高频数据中。时间序列语言模型(TSLM)能够摄取时间序列数据并用自然语言表达异常发现;然而,最近的基准测试报告显示,长上下文中的检索性能有所下降,反映了文本、视觉和音频中的失败模式。在文本域中,递归语言模型 (RLM) 可以通过将上下文保留在 大语言模型 (LLM) 外部来恢复大部分性能损失,从而允许模型通过代码对其进行查询。我们提出了 TimeRLM,这是一种用于时间序列的 RLM 公式,它使用代码和视觉功能顺序操纵信号。我们进一步介绍了 AnomalyXL,这是一种合成的长上下文异常定位基准,其中包含需要精确检索的以编程方式注入的异常。我们实现了五种不同的任务类别和两种变体:AnomalyXL-MCQ 和 AnomalyXL-Localize。 TimeRLM 在五个 AnomalyXL-Localize 任务中的四个上优于每个评估的 TSLM 和单通道基线,在定位上达到 0.682 IoU,在证据分类上达到 0.745,而所有基线的 IoU 最多为 0.329 和 0.072。我们使用强化学习对 TimeRLM 进行后训练。由此产生的模型进一步提高了性能,并且需要大约三分之一的代理交互次数来产生最终答案。在看不见的真实世界心电图、睡眠和软件可观测性记录中,训练后的 TimeRLM 保留或提高了性能,尽管专门针对合成数据进行了训练,但仍超越了 TSLM。我们的研究结果表明,与时间序列的递归交互是长范围检索的有效方法。