论文
超越标记化:时间序列问答的直接时间步嵌入和对比对齐
Beyond Tokenization: Direct Timestep Embedding and Contrastive Alignment for Time-Series Question Answering
摘要
大语言模型 (LLM) 的最新进展催生了时间序列问答 (TSQA),它将时间序列分析表述为自然语言问答。然而,直接将原始数值序列输入 LLM 会遇到标记化瓶颈:字节对编码将连续值分割成不稳定的标记,这些标记的嵌入缺乏有意义的度量结构,导致幅度、尺度和趋势信息的丢失。先前的方法使用基于补丁的编码器,将序列分割成固定窗口,通过一个很少跨不同长度或采样率的数据集传输的单独模块锁定一个打破模式并隐藏精确时间步长的粒度。为了应对这一挑战,我们提出了 CADE(直接嵌入对比对齐),这是一种基于两个关键组件的 TSQA 新颖框架:直接时间步嵌入和语义对齐。所提出的框架通过逐点线性编码器和 MLP 投影仪将每个时间步直接映射到 LLM 嵌入空间,保留精确的索引级访问,同时消除修补和填充的需要。为了进一步弥合时间序列和语言表示之间的语义差距,我们引入了一种新颖的单向监督对比损失,它将时间序列嵌入与冻结的类名文本锚对齐。公共 Time-MQA 基准的实验结果表明,我们的框架持续提高了六个 TSQA 任务的性能,优于开源和专有的 LLM 基准。