论文

超越相似性:时间序列分析的时间算子注意力

Beyond Similarity: Temporal Operator Attention for Time Series Analysis

模型架构Transformer

摘要

时间序列预测中一个持续存在的悖论是,结构简单的 MLP 和线性模型通常优于高容量 Transformer。我们认为,这种差距是由于序列建模原语中的不匹配而产生的:虽然许多时间序列动态是由全局时间算子(例如过滤和谐波结构)控制的,但标准注意力将每个输出形成为输入的凸组合。这限制了它表示对时间信号处理至关重要的符号变换和振荡变换的能力。我们将这种限制形式化为 softmax 注意力中的单纯形约束混合瓶颈,这对于算子驱动的时间序列任务尤其具有限制性。为了解决这个问题,我们提出了 $\textbf{Temporal Operator Attention (TOA)}$,这是一个框架,通过显式的、可学习的序列空间运算符来增强注意力,从而实现跨时间的直接符号混合,同时保留依赖于输入的自适应性。为了使密集的 $N \times N$ 运算符实用,我们引入了随机运算符正则化,这是一种高方差 dropout 机制,可以稳定训练并防止琐碎的记忆。在预测、异常检测和分类基准方面,TOA 在集成到 PatchTST 和 iTransformer 等标准主干中后,不断提高性能,在重建繁重的任务中表现尤其强劲。这些结果表明,显式算子学习是有效时间序列建模的关键要素。